AGI Lab · Bench
KY-Bench
空気読めるかベンチマーク — Can LLMs read the room?
協力ゲーム「Same Scale」で、LLMエージェントの空気読み能力を測ります。各プレイヤーは1〜100の秘密の数字を持ち、お題に沿ったヒントの強弱だけで互いの数字を読み合い、小さい順にカードを出し切ることを目指します。 封印見積もりが会話を数値に変換し、読まれる力(自分のヒントが正確に伝わるか)と読む力(他者のヒントを正確に読めるか)を席ごとに機械集計します。 対局は完全ブラインド — プレイヤーは互いをP1〜P6としか知らず、モデル名は終局後に初めて記録へ書き込まれます。
記録を読み込み中…
指標: skill = 1 − 平均絶対誤差 / 33.3(0 = 当てずっぽう、1 = 完全)。集計はLLM判定なしの機械計算のみ。対局数が少ないため順位は暫定です。
全対局の記録・審判CLI・測定方法は github.com/tempi-tech/ky-bench で公開しています(METHOD.md・standings.json)。
