AIモデルを比較
数値表
| モデル・推論設定 | 解決率 | 費用/試行(USD) | 時間 |
|---|---|---|---|
| GLM-5.3 (max) | 41.8 | 8.2655 | 97分 |
| Claude Opus 5.5 (low・フォールバックあり) | 31.3 | 2.0800 | 5分 |
| Claude Opus 5.5 (medium・フォールバックあり) | 52.5 | 4.0400 | 10分 |
| Claude Opus 5.5 (high・フォールバックあり) | 56.6 | 5.1200 | 13分 |
| Claude Opus 5.5 (xhigh・フォールバックあり) | 59.6 | 8.7800 | 20分 |
| Claude Opus 5.5 (max・フォールバックあり) | 59.6 | 13.1100 | 28分 |
| GPT-6.1 Sol (max) | 56.1 | 1.8228 | 27分 |
| GPT-6.1 Sol (low) | 30.8 | 0.3829 | 4分 |
| GPT-6.1 Sol (medium) | 48.0 | 0.6138 | 9分 |
| GPT-6.1 Sol (high) | 51.5 | 0.8282 | 11分 |
| GPT-6.1 Sol (xhigh) | 54.0 | 1.0259 | 15分 |
| GLM-5.3 (low) | 34.8 | 6.4049 | 未収録 |
AutomationBench 1.0.6:スコア
OpenAIが自社モデルを研究環境またはAPIで評価したAutomationBench 1.0.6のスコアです。全目標を達成したタスクの割合とは異なります。
| モデル・実行構成 | % |
|---|---|
| GLM-5.3max | この評価の公表値は未収録 |
| GPT-6.1 Solmedium | この評価の公表値は未収録 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
AutomationBench 1.0.6:1タスクの費用
OpenAIがAutomationBench 1.0.6で公表した1タスクあたりの費用です。APIの100万トークン単価とは異なります。
| モデル・実行構成 | 1タスクあたり・USD |
|---|---|
| GLM-5.3max | この評価の公表値は未収録 |
| GPT-6.1 Solmedium | この評価の公表値は未収録 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
SMS迷惑判定:正答率
正解ラベルと一致した件数を500件で割った割合です。SMSは2分類、Banking77は77分類です。汎用知識やコード生成の能力は測っていません。
| モデル・実行構成 | % |
|---|---|
| GLM-5.3max | この評価の公表値は未収録 |
| GPT-6.1 Solmedium | この評価の公表値は未収録 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
SMS迷惑判定:処理時間 p50
500要求の処理時間を小さい順に並べた中央値です。ネットワーク・提供環境・出力形式を含みます。最初の応答までの時間(TTFT)ではありません。
| モデル・実行構成 | ms |
|---|---|
| GLM-5.3max | この評価の公表値は未収録 |
| GPT-6.1 Solmedium | この評価の公表値は未収録 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
SMS迷惑判定:処理時間 p95
500要求を昇順に並べ、floor(0.95 × (n − 1))番目を採った公開実装のp95です。遅い側の処理時間を示します。
| モデル・実行構成 | ms |
|---|---|
| GLM-5.3max | この評価の公表値は未収録 |
| GPT-6.1 Solmedium | この評価の公表値は未収録 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
SMS迷惑判定:1,000件の費用
評価時の費用合計を件数で割り、1,000倍した金額です。APIの100万トークン単価や自社運用の費用とは異なります。
| モデル・実行構成 | 1,000件あたり・USD |
|---|---|
| GLM-5.3max | この評価の公表値は未収録 |
| GPT-6.1 Solmedium | この評価の公表値は未収録 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
Banking77問い合わせ分類:正答率
正解ラベルと一致した件数を500件で割った割合です。SMSは2分類、Banking77は77分類です。汎用知識やコード生成の能力は測っていません。
| モデル・実行構成 | % |
|---|---|
| GLM-5.3max | この評価の公表値は未収録 |
| GPT-6.1 Solmedium | この評価の公表値は未収録 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
Banking77問い合わせ分類:処理時間 p50
500要求の処理時間を小さい順に並べた中央値です。ネットワーク・提供環境・出力形式を含みます。最初の応答までの時間(TTFT)ではありません。
| モデル・実行構成 | ms |
|---|---|
| GLM-5.3max | この評価の公表値は未収録 |
| GPT-6.1 Solmedium | この評価の公表値は未収録 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
Banking77問い合わせ分類:処理時間 p95
500要求を昇順に並べ、floor(0.95 × (n − 1))番目を採った公開実装のp95です。遅い側の処理時間を示します。
| モデル・実行構成 | ms |
|---|---|
| GLM-5.3max | この評価の公表値は未収録 |
| GPT-6.1 Solmedium | この評価の公表値は未収録 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
Banking77問い合わせ分類:1,000件の費用
評価時の費用合計を件数で割り、1,000倍した金額です。APIの100万トークン単価や自社運用の費用とは異なります。
| モデル・実行構成 | 1,000件あたり・USD |
|---|---|
| GLM-5.3max | この評価の公表値は未収録 |
| GPT-6.1 Solmedium | この評価の公表値は未収録 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
T-Rex:60秒生存率
5シードのうち60秒間生存した割合です。物理プランナーとshieldの介入を含む結果で、モデル単体の正確さや他用途への性能を示しません。
| モデル・実行構成 | % |
|---|---|
| GLM-5.3max | この評価の公表値は未収録 |
| GPT-6.1 Solmedium | この評価の公表値は未収録 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
T-Rex:処理時間 p50の中央値
APIのJevとローカルRTX 4090のCLMは実行条件が異なります。通信・実行環境を含むシステムの時間で、モデル単体の速度比較には使えません。
| モデル・実行構成 | ms |
|---|---|
| GLM-5.3max | この評価の公表値は未収録 |
| GPT-6.1 Solmedium | この評価の公表値は未収録 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
Terminal-Bench 4.0
Terminal-Benchは、AIエージェントがターミナルを使って作業を完了する能力を測るベンチマークです。4.0の解決率を0〜100%で示し、数値が高いほど多くの作業を完了できたことを表します。
| モデル・実行構成 | % |
|---|---|
| GPT-6.1 Solmax | 56.06 |
| GPT-6.1 Solxhigh | 54.04 |
| GPT-6.1 Solhigh | 51.52 |
| GPT-6.1 Solmedium | 47.98 |
| GLM-5.3max | 41.8295% CI half-width ±3.23 percentage points |
| GLM-5.3low | 34.85 |
| GPT-6.1 Sollow | 30.81 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
Terminal-Bench 4.0:実行コスト
Terminal-Bench 4.0で報告された、330試行の評価にかかった合計費用です。単位は米ドル(USD)で、数値が小さいほど低コストです。APIのトークン単価や月額料金とは異なります。
| モデル・実行構成 | 330試行の合計・USD |
|---|---|
| GLM-5.3max | 2,727.63 |
| GPT-6.1 Solmedium | この評価の公表値は未収録 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
Terminal-Bench 4.0:平均試行時間
Terminal-Bench 4.0で、1試行を終えるまでにかかった平均時間です。分(1分以下は秒)で表示し、数値が小さいほど短時間で試行を終えています。応答を返し始めるまでの待ち時間とは異なります。
| モデル・実行構成 | 分・秒 |
|---|---|
| GLM-5.3max | 97分 |
| GPT-6.1 Solmedium | この評価の公表値は未収録 |
| Claude Opus 5.5 | この評価の公表値は未収録 |
API料金
| 実行構成 | 種別・単価 | 適用条件・出典 |
|---|---|---|
| GLM-5.3 / Z.ai API | input: 1.4 USD / 1M tokens | 条件・出典Z.ai Model APIの公開トークン単価。USD/100万トークン。キャッシュは読取料金で、保存料金の期間限定無料と区別。Coding Planの月額・ポイント、ツール料金を含まない。料金表にコンテキスト長別の追加単価の記載なし。(確認日 2026-09-30) Z.ai API pricing |
| GLM-5.3 / Z.ai API | output: 4.4 USD / 1M tokens | 条件・出典Z.ai Model APIの公開トークン単価。USD/100万トークン。キャッシュは読取料金で、保存料金の期間限定無料と区別。Coding Planの月額・ポイント、ツール料金を含まない。料金表にコンテキスト長別の追加単価の記載なし。(確認日 2026-09-30) Z.ai API pricing |
| GLM-5.3 / Z.ai API | cache: 0.26 USD / 1M tokens | 条件・出典Z.ai Model APIの公開トークン単価。USD/100万トークン。キャッシュは読取料金で、保存料金の期間限定無料と区別。Coding Planの月額・ポイント、ツール料金を含まない。料金表にコンテキスト長別の追加単価の記載なし。(確認日 2026-09-30) Z.ai API pricing |
| Claude Opus 5.5 / Anthropic standard API | input: 4 USD / 1M tokens | 条件・出典Claude API standard rate; cache read only, excluding 5-minute/1-hour cache writes and fast mode
モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(確認日 2026-09-27) platform.claude.com |
| Claude Opus 5.5 / Anthropic standard API | output: 20 USD / 1M tokens | 条件・出典Claude API standard rate; cache read only, excluding 5-minute/1-hour cache writes and fast mode
モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(確認日 2026-09-27) platform.claude.com |
| Claude Opus 5.5 / Anthropic standard API | cache: 0.2 USD / 1M tokens | 条件・出典Claude API standard rate; cache read only, excluding 5-minute/1-hour cache writes and fast mode
モデルに対応する標準APIの単価。性能評価に使用された構成・実行費用とは別。(確認日 2026-09-27) platform.claude.com |
| GPT-6.1 Sol / OpenAI standard API | input: 2 USD / 1M tokens | 条件・出典Standard API、入力272,000トークン以下、100万トークンあたりUSD。272,000を超える場合はリクエスト全体の入力・キャッシュ料金が2倍、出力が1.5倍。キャッシュ書込は別料金2.50ドル。Fastは標準の2倍、Batch/Flexは標準の50%、地域処理は対象地域で10%加算。性能評価の実行費用ではない。Ultrafastは対象外。(確認日 2026-09-29T21:56:13Z) OpenAI GPT-6.1 Sol API仕様・料金 / OpenAI API Changelog: GPT-6.1 Sol公開日 |
| GPT-6.1 Sol / OpenAI standard API | output: 10 USD / 1M tokens | 条件・出典Standard API、入力272,000トークン以下、100万トークンあたりUSD。272,000を超える場合はリクエスト全体の入力・キャッシュ料金が2倍、出力が1.5倍。キャッシュ書込は別料金2.50ドル。Fastは標準の2倍、Batch/Flexは標準の50%、地域処理は対象地域で10%加算。性能評価の実行費用ではない。Ultrafastは対象外。(確認日 2026-09-29T21:56:13Z) OpenAI GPT-6.1 Sol API仕様・料金 / OpenAI API Changelog: GPT-6.1 Sol公開日 |
| GPT-6.1 Sol / OpenAI standard API | cache: 0.1 USD / 1M tokens | 条件・出典Standard API、入力272,000トークン以下、100万トークンあたりUSD。272,000を超える場合はリクエスト全体の入力・キャッシュ料金が2倍、出力が1.5倍。キャッシュ書込は別料金2.50ドル。Fastは標準の2倍、Batch/Flexは標準の50%、地域処理は対象地域で10%加算。性能評価の実行費用ではない。Ultrafastは対象外。(確認日 2026-09-29T21:56:13Z) OpenAI GPT-6.1 Sol API仕様・料金 / OpenAI API Changelog: GPT-6.1 Sol公開日 |
