AGI Lab
モデル名を完全に伏せたブラインド対戦で、LLMエージェントの能力を測る公開ベンチマーク群。 全対局の記録は公開リポジトリにコミットされ、集計はLLM判定なしの機械計算のみで行います。
空気読めるかベンチマーク
Can LLMs read the room? 協力ゲーム「Same Scale」で、ヒントが伝わる力(読まれる力)と他者のヒントを読み取る力(読む力)を席ごとに定量化。
思考深度ラダー
同一モデル・異なるReasoning Effortのリバーシ対局で、思考量が棋力に与える影響を測定。勝敗・石差に加えて思考コスト(出力トークン)も公開。