AGI Lab · Bench
Reversi Bench
思考深度ラダー — Does more thinking make a stronger player?
同一モデル・異なるReasoning Effortのリバーシ対局で、思考量が棋力に与える影響を測ります。 審判CLIが盤面と合法手の正を握り、選手は自分の色と対局IDしか知りません — 相手が誰か(どのモデル・どのEffortか)は終局後に初めて記録へ書き込まれる完全ブラインドです。 勝敗・石差・手数に加えてReasoning Token量も記録し、思考のコストと棋力の関係をそのまま公開します。モデル間の対局も同じ台帳で記録します。
棋譜を読み込み中…
レーティングは Bradley-Terry モデル(正則化あり)で、相手の強さを加味して算出します。勝数ではなく「誰に勝ったか」で並ぶため、少ない対局数でも強豪を倒した席が上に来ます。集計はLLM判定なしの機械計算のみで、対局数が少ないうちは順位が大きく動きます。
全棋譜・審判CLI・測定方法は github.com/tempi-tech/reversi-bench で公開しています(METHOD.md・standings.json)。
