本文へ移動

開発元のAIモデル

数値表

Terminal-Bench 4.0

Terminal-Benchは、AIエージェントがターミナルを使って作業を完了する能力を測るベンチマークです。4.0の解決率を0〜100%で示し、数値が高いほど多くの作業を完了できたことを表します。
モデル・実行構成%
Claude Sonnet 5.5max 70.60
Claude Sonnet 5.5xhigh 61.50
Fable 5.1max 57.8895% CI half-width ±3.76 percentage points
Fable 5.1xhigh 57.8895% CI half-width ±3.36 percentage points
Fable 5.1high 54.5595% CI half-width ±3.44 percentage points
Fable 5.1medium 53.9495% CI half-width ±3.39 percentage points
Opus 5max 51.8295% CI half-width ±3.39 percentage points
Fable 5max 44.5595% CI half-width ±3.85 percentage points
Fable 5.1low 43.3395% CI half-width ±3.61 percentage points
Claude Sonnet 5.5high 43.00
Claude Sonnet 5.5medium 28.80
Opus 4.8max 23.6495% CI half-width ±3.56 percentage points
Claude Sonnet 5.5low 20.00
Sonnet 5max 12.4295% CI half-width ±3.06 percentage points
Claude Opus 5.5 この評価の公表値は未収録

Terminal-Bench 4.0:実行コスト

Terminal-Bench 4.0で報告された、330試行の評価にかかった合計費用です。単位は米ドル(USD)で、数値が小さいほど低コストです。APIのトークン単価や月額料金とは異なります。
モデル・実行構成330試行の合計・USD
Fable 5.1low 2,358.72
Fable 5.1medium 2,832.90
Fable 5.1high 3,985.38
Fable 5.1xhigh 4,872.04
Opus 5max 5,969.11
Fable 5.1max 6,243.50
Opus 4.8max 6,481.26
Fable 5max 7,265.01
Sonnet 5max 9,603.86
Claude Sonnet 5.5low この評価の公表値は未収録
Claude Opus 5.5 この評価の公表値は未収録

TB4 平均試行時間

Terminal-Bench 4.0で、1試行を終えるまでにかかった平均時間です。単位は秒で、数値が小さいほど短時間で試行を終えています。応答を返し始めるまでの待ち時間とは異なります。
モデル・実行構成秒
Fable 5.1low 2,290.80
Fable 5.1medium 2,528.30
Fable 5.1high 3,017.70
Fable 5.1xhigh 3,202.10
Fable 5.1max 3,893.50
Fable 5max 4,202.80
Opus 5max 4,792.80
Opus 4.8max 5,163.00
Sonnet 5max 6,510.30
Claude Sonnet 5.5low この評価の公表値は未収録
Claude Opus 5.5 この評価の公表値は未収録

ECI総合スコア

epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。 / epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。 / epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。 / epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。 / epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。 / epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。 / epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。 / epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。 / epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。 / epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。 / epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。 / epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。 / epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。 / epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。 / epoch.ai / Epoch AI, Epoch Capabilities Index / 取得日 2026-09-28 / CC BY 4.0 / 完成済みGeneral ECIを抽出。点数は変更せず表示時に丸める。標準API料金との組合せはDotMargin。

Epoch AIが公開するGeneral ECIです。高いほど総合性能が高いことを示します。正答率や100点満点の点数ではありません。同じ取得版の値で比較し、未収録モデルを別モデルの値で代用しません。
モデル・実行構成ECI参考API料金(USD)入力10,000・出力1,000トークン
Fable 5.1 165.00 0.150000Anthropic / 入力10,000・出力1,000トークン。キャッシュ・バッチ割引・追加推論量・ツール費を含まない参考料金。ECI測定やタスク完了の実費ではありません。Claude API standard pricing; Fable 5.1 only, excluding fallback model usage モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(料金確認日 2026-09-27)platform.claude.com / platform.claude.com
Fable 5 163.60 未収録対応する標準入力・出力料金は未収録
Opus 5 162.67 未収録対応する標準入力・出力料金は未収録
Opus 4.8 158.30 未収録対応する標準入力・出力料金は未収録
Sonnet 5 156.34 未収録対応する標準入力・出力料金は未収録
Claude Sonnet 5.5low この評価の公表値は未収録 0.030000Anthropic / 入力10,000・出力1,000トークン。キャッシュ・バッチ割引・追加推論量・ツール費を含まない参考料金。ECI測定やタスク完了の実費ではありません。Claude API Standard。キャッシュ入力は読取料金。キャッシュ書込・Batch料金・別モデルへのフォールバック利用分は別。 モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(料金確認日 2026-09-29)platform.claude.com / platform.claude.com
Claude Opus 5.5 この評価の公表値は未収録 0.060000Anthropic / 入力10,000・出力1,000トークン。キャッシュ・バッチ割引・追加推論量・ツール費を含まない参考料金。ECI測定やタスク完了の実費ではありません。Claude API standard rate; cache read only, excluding 5-minute/1-hour cache writes and fast mode モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(料金確認日 2026-09-27)platform.claude.com / platform.claude.com

SMS迷惑判定:正答率

正解ラベルと一致した件数を500件で割った割合です。SMSは2分類、Banking77は77分類です。汎用知識やコード生成の能力は測っていません。
モデル・実行構成%
Fable 5.1max この評価の公表値は未収録
Opus 5max この評価の公表値は未収録
Fable 5max この評価の公表値は未収録
Opus 4.8max この評価の公表値は未収録
Sonnet 5max この評価の公表値は未収録
Claude Sonnet 5.5low この評価の公表値は未収録
Claude Opus 5.5 この評価の公表値は未収録

SMS迷惑判定:処理時間 p50

500要求の処理時間を小さい順に並べた中央値です。ネットワーク・提供環境・出力形式を含みます。最初の応答までの時間(TTFT)ではありません。
モデル・実行構成ms
Fable 5.1max この評価の公表値は未収録
Opus 5max この評価の公表値は未収録
Fable 5max この評価の公表値は未収録
Opus 4.8max この評価の公表値は未収録
Sonnet 5max この評価の公表値は未収録
Claude Sonnet 5.5low この評価の公表値は未収録
Claude Opus 5.5 この評価の公表値は未収録

SMS迷惑判定:処理時間 p95

500要求を昇順に並べ、floor(0.95 × (n − 1))番目を採った公開実装のp95です。遅い側の処理時間を示します。
モデル・実行構成ms
Fable 5.1max この評価の公表値は未収録
Opus 5max この評価の公表値は未収録
Fable 5max この評価の公表値は未収録
Opus 4.8max この評価の公表値は未収録
Sonnet 5max この評価の公表値は未収録
Claude Sonnet 5.5low この評価の公表値は未収録
Claude Opus 5.5 この評価の公表値は未収録

SMS迷惑判定:1,000件の費用

評価時の費用合計を件数で割り、1,000倍した金額です。APIの100万トークン単価や自社運用の費用とは異なります。
モデル・実行構成1,000件あたり・USD
Fable 5.1max この評価の公表値は未収録
Opus 5max この評価の公表値は未収録
Fable 5max この評価の公表値は未収録
Opus 4.8max この評価の公表値は未収録
Sonnet 5max この評価の公表値は未収録
Claude Sonnet 5.5low この評価の公表値は未収録
Claude Opus 5.5 この評価の公表値は未収録

Banking77問い合わせ分類:正答率

正解ラベルと一致した件数を500件で割った割合です。SMSは2分類、Banking77は77分類です。汎用知識やコード生成の能力は測っていません。
モデル・実行構成%
Fable 5.1max この評価の公表値は未収録
Opus 5max この評価の公表値は未収録
Fable 5max この評価の公表値は未収録
Opus 4.8max この評価の公表値は未収録
Sonnet 5max この評価の公表値は未収録
Claude Sonnet 5.5low この評価の公表値は未収録
Claude Opus 5.5 この評価の公表値は未収録

Banking77問い合わせ分類:処理時間 p50

500要求の処理時間を小さい順に並べた中央値です。ネットワーク・提供環境・出力形式を含みます。最初の応答までの時間(TTFT)ではありません。
モデル・実行構成ms
Fable 5.1max この評価の公表値は未収録
Opus 5max この評価の公表値は未収録
Fable 5max この評価の公表値は未収録
Opus 4.8max この評価の公表値は未収録
Sonnet 5max この評価の公表値は未収録
Claude Sonnet 5.5low この評価の公表値は未収録
Claude Opus 5.5 この評価の公表値は未収録

Banking77問い合わせ分類:処理時間 p95

500要求を昇順に並べ、floor(0.95 × (n − 1))番目を採った公開実装のp95です。遅い側の処理時間を示します。
モデル・実行構成ms
Fable 5.1max この評価の公表値は未収録
Opus 5max この評価の公表値は未収録
Fable 5max この評価の公表値は未収録
Opus 4.8max この評価の公表値は未収録
Sonnet 5max この評価の公表値は未収録
Claude Sonnet 5.5low この評価の公表値は未収録
Claude Opus 5.5 この評価の公表値は未収録

Banking77問い合わせ分類:1,000件の費用

評価時の費用合計を件数で割り、1,000倍した金額です。APIの100万トークン単価や自社運用の費用とは異なります。
モデル・実行構成1,000件あたり・USD
Fable 5.1max この評価の公表値は未収録
Opus 5max この評価の公表値は未収録
Fable 5max この評価の公表値は未収録
Opus 4.8max この評価の公表値は未収録
Sonnet 5max この評価の公表値は未収録
Claude Sonnet 5.5low この評価の公表値は未収録
Claude Opus 5.5 この評価の公表値は未収録

T-Rex:60秒生存率

5シードのうち60秒間生存した割合です。物理プランナーとshieldの介入を含む結果で、モデル単体の正確さや他用途への性能を示しません。
モデル・実行構成%
Fable 5.1max この評価の公表値は未収録
Opus 5max この評価の公表値は未収録
Fable 5max この評価の公表値は未収録
Opus 4.8max この評価の公表値は未収録
Sonnet 5max この評価の公表値は未収録
Claude Sonnet 5.5low この評価の公表値は未収録
Claude Opus 5.5 この評価の公表値は未収録

T-Rex:処理時間 p50の中央値

APIのJevとローカルRTX 4090のCLMは実行条件が異なります。通信・実行環境を含むシステムの時間で、モデル単体の速度比較には使えません。
モデル・実行構成ms
Fable 5.1max この評価の公表値は未収録
Opus 5max この評価の公表値は未収録
Fable 5max この評価の公表値は未収録
Opus 4.8max この評価の公表値は未収録
Sonnet 5max この評価の公表値は未収録
Claude Sonnet 5.5low この評価の公表値は未収録
Claude Opus 5.5 この評価の公表値は未収録

AutomationBench 1.0.6:スコア

OpenAIが自社モデルを研究環境またはAPIで評価したAutomationBench 1.0.6のスコアです。全目標を達成したタスクの割合とは異なります。
モデル・実行構成%
Fable 5.1max この評価の公表値は未収録
Opus 5max この評価の公表値は未収録
Fable 5max この評価の公表値は未収録
Opus 4.8max この評価の公表値は未収録
Sonnet 5max この評価の公表値は未収録
Claude Sonnet 5.5low この評価の公表値は未収録
Claude Opus 5.5 この評価の公表値は未収録

AutomationBench 1.0.6:1タスクの費用

OpenAIがAutomationBench 1.0.6で公表した1タスクあたりの費用です。APIの100万トークン単価とは異なります。
モデル・実行構成1タスクあたり・USD
Fable 5.1max この評価の公表値は未収録
Opus 5max この評価の公表値は未収録
Fable 5max この評価の公表値は未収録
Opus 4.8max この評価の公表値は未収録
Sonnet 5max この評価の公表値は未収録
Claude Sonnet 5.5low この評価の公表値は未収録
Claude Opus 5.5 この評価の公表値は未収録

API料金

実行構成種別・単価適用条件・出典
Claude Opus 5.5 / Anthropic standard APIinput: 4 USD / 1M tokensClaude API standard rate; cache read only, excluding 5-minute/1-hour cache writes and fast mode モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(確認日 2026-09-27) platform.claude.com
Claude Opus 5.5 / Anthropic standard APIoutput: 20 USD / 1M tokensClaude API standard rate; cache read only, excluding 5-minute/1-hour cache writes and fast mode モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(確認日 2026-09-27) platform.claude.com
Claude Opus 5.5 / Anthropic standard APIcache: 0.2 USD / 1M tokensClaude API standard rate; cache read only, excluding 5-minute/1-hour cache writes and fast mode モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(確認日 2026-09-27) platform.claude.com
Fable 5.1 / Anthropic standard APIinput: 10 USD / 1M tokensClaude API standard pricing; Fable 5.1 only, excluding fallback model usage モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(確認日 2026-09-27) platform.claude.com
Fable 5.1 / Anthropic standard APIoutput: 50 USD / 1M tokensClaude API standard pricing; Fable 5.1 only, excluding fallback model usage モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(確認日 2026-09-27) platform.claude.com
Fable 5.1 / Anthropic standard APIcache: 0.25 USD / 1M tokensClaude API standard pricing; Fable 5.1 only, excluding fallback model usage モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(確認日 2026-09-27) platform.claude.com
Claude Sonnet 5.5 / Anthropic standard APIinput: 2 USD / 1M tokensClaude API Standard。キャッシュ入力は読取料金。キャッシュ書込・Batch料金・別モデルへのフォールバック利用分は別。 モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(確認日 2026-09-29) platform.claude.com
Claude Sonnet 5.5 / Anthropic standard APIoutput: 10 USD / 1M tokensClaude API Standard。キャッシュ入力は読取料金。キャッシュ書込・Batch料金・別モデルへのフォールバック利用分は別。 モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(確認日 2026-09-29) platform.claude.com
Claude Sonnet 5.5 / Anthropic standard APIcache: 0.2 USD / 1M tokensClaude API Standard。キャッシュ入力は読取料金。キャッシュ書込・Batch料金・別モデルへのフォールバック利用分は別。 モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(確認日 2026-09-29) platform.claude.com