AIモデル比較
数値表
注目のAIモデル比較
Terminal-Bench 4.0
Terminal-Benchは、AIエージェントがターミナルを使って作業を完了する能力を測るベンチマークです。4.0の解決率を0〜100%で示し、数値が高いほど多くの作業を完了できたことを表します。
| モデル・実行構成 | % |
|---|---|
| Claude Sonnet 5.5max | 70.60 |
| Claude Sonnet 5.5xhigh | 61.50 |
| GPT-6 Astramax | 58.1895% CI half-width ±2.79 percentage points |
Terminal-Bench 4.0:実行コスト
Terminal-Bench 4.0で報告された、330試行の評価にかかった合計費用です。単位は米ドル(USD)で、数値が小さいほど低コストです。APIのトークン単価や月額料金とは異なります。
| モデル・実行構成 | 330試行の合計・USD |
|---|---|
| GPT-5.6 Lunamax | 346.67 |
| Gemini 3.7 Flashhigh | 1,261.87 |
| GPT-6 Astralow | 1,557.30 |
TB4 平均試行時間
Terminal-Bench 4.0で、1試行を終えるまでにかかった平均時間です。単位は秒で、数値が小さいほど短時間で試行を終えています。応答を返し始めるまでの待ち時間とは異なります。
| モデル・実行構成 | 秒 |
|---|---|
| GPT-6 Astralow | 1,683.70 |
| Gemini 3.7 Flashhigh | 1,688.90 |
| GPT-6 Astramedium | 1,885.90 |
