本文へ移動

AIモデル比較

数値表
モデル・推論設定解決率費用/試行(USD)時間(分)
GPT-6 Astra (max)58.29.900546.6
Fable 5.1 (max)57.918.919764.9
GPT-6 Astra (xhigh)57.97.122836.8
GPT-6 Astra (high)57.96.877035.2
GPT-6 Astra (medium)54.25.802431.4
Opus 5 (max)51.818.088279.9
GPT-6 Astra (low)50.64.719128.1
Fable 5 (max)44.622.015270.0
GLM-5.3 (max)41.88.265597.2
GPT-5.6 Sol (max)37.37.702139.8
Opus 4.8 (max)23.619.640286.1
GPT-5.6 Terra (max)21.55.253141.9
Grok 4.6 (high)20.310.883639.2
Gemini 3.8 Flash (high)19.15.541733.3
GPT-5.6 Luna (max)17.31.050568.1
Grok 4.5 (high)12.46.345852.7
Sonnet 5 (max)12.429.1026108.5
Gemini 3.7 Flash (high)11.23.823828.1
Fable 5.1 (xhigh)57.914.763853.4
Fable 5.1 (high)54.612.076950.3
Fable 5.1 (medium)53.98.584542.1
Fable 5.1 (low)43.37.147638.2
Claude Sonnet 5.5 (low)20.00.75724.6
Claude Sonnet 5.5 (medium)28.80.83474.9
Claude Sonnet 5.5 (high)43.01.94018.0
Claude Sonnet 5.5 (xhigh)61.55.298017.2
Claude Sonnet 5.5 (max)70.612.540628.2
GPT-6 Sol (low)9.10.49003.3
GPT-6 Sol (medium)18.71.12005.6
GPT-6 Sol (high)26.31.60007.8
GPT-6 Sol (xhigh)30.31.910010.3
GPT-6 Sol (max)43.94.000018.0
Claude Opus 5.5 (low・フォールバックあり)31.32.08005.0
Claude Opus 5.5 (medium・フォールバックあり)52.54.04009.9
Claude Opus 5.5 (high・フォールバックあり)56.65.120012.6
Claude Opus 5.5 (xhigh・フォールバックあり)59.68.780020.1
Claude Opus 5.5 (max・フォールバックあり)59.613.110027.5
Gemini 3.8 Flash (low)10.15.38009.2
Gemini 3.8 Flash (medium)19.74.61008.6
GPT-6 Luna (low)0.00.01000.4
GPT-6 Luna (medium)2.50.07004.2
GPT-6 Luna (high)4.50.12008.0
GPT-6 Luna (xhigh)8.10.200011.0
GPT-6 Luna (max)12.60.240014.1

注目のAIモデル比較

Terminal-Bench 4.0

Terminal-Benchは、AIエージェントがターミナルを使って作業を完了する能力を測るベンチマークです。4.0の解決率を0〜100%で示し、数値が高いほど多くの作業を完了できたことを表します。
モデル・実行構成%
Claude Sonnet 5.5max 70.60
Claude Sonnet 5.5xhigh 61.50
GPT-6 Astramax 58.1895% CI half-width ±2.79 percentage points

Terminal-Bench 4.0:実行コスト

Terminal-Bench 4.0で報告された、330試行の評価にかかった合計費用です。単位は米ドル(USD)で、数値が小さいほど低コストです。APIのトークン単価や月額料金とは異なります。
モデル・実行構成330試行の合計・USD
GPT-5.6 Lunamax 346.67
Gemini 3.7 Flashhigh 1,261.87
GPT-6 Astralow 1,557.30

TB4 平均試行時間

Terminal-Bench 4.0で、1試行を終えるまでにかかった平均時間です。単位は秒で、数値が小さいほど短時間で試行を終えています。応答を返し始めるまでの待ち時間とは異なります。
モデル・実行構成秒
GPT-6 Astralow 1,683.70
Gemini 3.7 Flashhigh 1,688.90
GPT-6 Astramedium 1,885.90