AIエージェント開発でLLM as a Judgeを機能させるには、評価AIを用意するだけでは不十分です。人間の暗黙知を評価基準へ落とし込み、実行ログをテストケースとして蓄積し、評価器であるLLM自体のズレも継続的に点検する運用設計が必要です。 こちらの記事 では、AIがAIを評価する仕組みである「LLM as a Judge」の基本的な考え方を紹介しました。しかし、実際にLLM as a Judgeを導入するのはそう簡単ではありません。 本記事では、dotDataで開発した「UseCase Adviso