点数が高ければ、本当に能力が高いと言えるのでしょうか。
視力2.0なのに黒板が読めない子のたとえから、LLMベンチマークとAgent Skillの評価を考えます。
445件のベンチマーク論文を調べた研究を紹介しながら、課題の選び方、採点、データ汚染、評価者の偏りを整理します。
評価で大事なのは、点数をつけることではなく、その点数が何の根拠になるのかを説明できることです。
Measuring what Matters: Construct Validity in Large Language Model Benchmarks
ホスト:kagaya(@ry0_kaga)
感想
まだ感想はありません。最初の1件を書きましょう!
スクロール