Diagnosing LLM Judge Reliability / Context Over Content
LLMジャッジは、生成AIの評価を安く速く回すための便利な道具として広まりました。転機になったのは、MT-BenchとChatbot Arenaの系譜で、強いLLMを審判役に置くと人手評価にかなり近い結果が得られる、と示されたことです。その後、この枠組みはベンチマーク、RLHF、RAG評価、社内QAまで一気に浸透しました。ですが、広く使われるようになったからこそ、いま問われているのは「LLMジャッジは便利か」ではなく、「測定器と... もっと見る