本文へ移動

AIモデルを比較

数値表
モデル・推論設定解決率費用/試行(USD)時間
GLM-5.3 (max)41.88.265597分
GLM-5.3 (low)34.86.4049未収録
DeepSeek V4 Pro 0813 (max)14.13.7552未収録
比較するモデル

AutomationBench 1.0.6:スコア

OpenAIが自社モデルを研究環境またはAPIで評価したAutomationBench 1.0.6のスコアです。全目標を達成したタスクの割合とは異なります。
モデル・実行構成%
DeepSeek V4 Pro 0813 この評価の公表値は未収録
GLM-5.3max この評価の公表値は未収録

AutomationBench 1.0.6:1タスクの費用

OpenAIがAutomationBench 1.0.6で公表した1タスクあたりの費用です。APIの100万トークン単価とは異なります。
モデル・実行構成1タスクあたり・USD
DeepSeek V4 Pro 0813 この評価の公表値は未収録
GLM-5.3max この評価の公表値は未収録

SMS迷惑判定:正答率

正解ラベルと一致した件数を500件で割った割合です。SMSは2分類、Banking77は77分類です。汎用知識やコード生成の能力は測っていません。
モデル・実行構成%
DeepSeek V4 Pro 0813 この評価の公表値は未収録
GLM-5.3max この評価の公表値は未収録

SMS迷惑判定:処理時間 p50

500要求の処理時間を小さい順に並べた中央値です。ネットワーク・提供環境・出力形式を含みます。最初の応答までの時間(TTFT)ではありません。
モデル・実行構成ms
DeepSeek V4 Pro 0813 この評価の公表値は未収録
GLM-5.3max この評価の公表値は未収録

SMS迷惑判定:処理時間 p95

500要求を昇順に並べ、floor(0.95 × (n − 1))番目を採った公開実装のp95です。遅い側の処理時間を示します。
モデル・実行構成ms
DeepSeek V4 Pro 0813 この評価の公表値は未収録
GLM-5.3max この評価の公表値は未収録

SMS迷惑判定:1,000件の費用

評価時の費用合計を件数で割り、1,000倍した金額です。APIの100万トークン単価や自社運用の費用とは異なります。
モデル・実行構成1,000件あたり・USD
DeepSeek V4 Pro 0813 この評価の公表値は未収録
GLM-5.3max この評価の公表値は未収録

Banking77問い合わせ分類:正答率

正解ラベルと一致した件数を500件で割った割合です。SMSは2分類、Banking77は77分類です。汎用知識やコード生成の能力は測っていません。
モデル・実行構成%
DeepSeek V4 Pro 0813 この評価の公表値は未収録
GLM-5.3max この評価の公表値は未収録

Banking77問い合わせ分類:処理時間 p50

500要求の処理時間を小さい順に並べた中央値です。ネットワーク・提供環境・出力形式を含みます。最初の応答までの時間(TTFT)ではありません。
モデル・実行構成ms
DeepSeek V4 Pro 0813 この評価の公表値は未収録
GLM-5.3max この評価の公表値は未収録

Banking77問い合わせ分類:処理時間 p95

500要求を昇順に並べ、floor(0.95 × (n − 1))番目を採った公開実装のp95です。遅い側の処理時間を示します。
モデル・実行構成ms
DeepSeek V4 Pro 0813 この評価の公表値は未収録
GLM-5.3max この評価の公表値は未収録

Banking77問い合わせ分類:1,000件の費用

評価時の費用合計を件数で割り、1,000倍した金額です。APIの100万トークン単価や自社運用の費用とは異なります。
モデル・実行構成1,000件あたり・USD
DeepSeek V4 Pro 0813 この評価の公表値は未収録
GLM-5.3max この評価の公表値は未収録

T-Rex:60秒生存率

5シードのうち60秒間生存した割合です。物理プランナーとshieldの介入を含む結果で、モデル単体の正確さや他用途への性能を示しません。
モデル・実行構成%
DeepSeek V4 Pro 0813 この評価の公表値は未収録
GLM-5.3max この評価の公表値は未収録

T-Rex:処理時間 p50の中央値

APIのJevとローカルRTX 4090のCLMは実行条件が異なります。通信・実行環境を含むシステムの時間で、モデル単体の速度比較には使えません。
モデル・実行構成ms
DeepSeek V4 Pro 0813 この評価の公表値は未収録
GLM-5.3max この評価の公表値は未収録

Terminal-Bench 4.0

Terminal-Benchは、AIエージェントがターミナルを使って作業を完了する能力を測るベンチマークです。4.0の解決率を0〜100%で示し、数値が高いほど多くの作業を完了できたことを表します。
モデル・実行構成%
GLM-5.3max 41.8295% CI half-width ±3.23 percentage points
GLM-5.3low 34.85
DeepSeek V4 Pro 0813max 14.14

Terminal-Bench 4.0:実行コスト

Terminal-Bench 4.0で報告された、330試行の評価にかかった合計費用です。単位は米ドル(USD)で、数値が小さいほど低コストです。APIのトークン単価や月額料金とは異なります。
モデル・実行構成330試行の合計・USD
GLM-5.3max 2,727.63
DeepSeek V4 Pro 0813 この評価の公表値は未収録

Terminal-Bench 4.0:平均試行時間

Terminal-Bench 4.0で、1試行を終えるまでにかかった平均時間です。分(1分以下は秒)で表示し、数値が小さいほど短時間で試行を終えています。応答を返し始めるまでの待ち時間とは異なります。
モデル・実行構成分・秒
GLM-5.3max 97分
DeepSeek V4 Pro 0813 この評価の公表値は未収録

API料金

実行構成種別・単価適用条件・出典
GLM-5.3 / Z.ai APIinput: 1.4 USD / 1M tokens
条件・出典
Z.ai Model APIの公開トークン単価。USD/100万トークン。キャッシュは読取料金で、保存料金の期間限定無料と区別。Coding Planの月額・ポイント、ツール料金を含まない。料金表にコンテキスト長別の追加単価の記載なし。(確認日 2026-09-30) Z.ai API pricing
GLM-5.3 / Z.ai APIoutput: 4.4 USD / 1M tokens
条件・出典
Z.ai Model APIの公開トークン単価。USD/100万トークン。キャッシュは読取料金で、保存料金の期間限定無料と区別。Coding Planの月額・ポイント、ツール料金を含まない。料金表にコンテキスト長別の追加単価の記載なし。(確認日 2026-09-30) Z.ai API pricing
GLM-5.3 / Z.ai APIcache: 0.26 USD / 1M tokens
条件・出典
Z.ai Model APIの公開トークン単価。USD/100万トークン。キャッシュは読取料金で、保存料金の期間限定無料と区別。Coding Planの月額・ポイント、ツール料金を含まない。料金表にコンテキスト長別の追加単価の記載なし。(確認日 2026-09-30) Z.ai API pricing
DeepSeek V4 Pro 0813 / DeepSeek APIinput: 1.32 USD / 1M tokens
条件・出典
DeepSeek APIのピーク料金(USD/100万トークン)を代表料金として使用。中国の祝日を除く月〜金のUTC 01:00〜04:00・06:00〜10:00に適用。その他の時間帯・土日・中国祝日は半額(入力0.66、出力1.98、キャッシュ読取0.022)。入力はcache miss、cacheはcache hit。モデルID deepseek-v4-pro、対応版DeepSeek-V4-Pro-0813。時間帯の異なる料金を平均・混合しない。(確認日 2026-09-30) DeepSeek API pricing
DeepSeek V4 Pro 0813 / DeepSeek APIoutput: 3.96 USD / 1M tokens
条件・出典
DeepSeek APIのピーク料金(USD/100万トークン)を代表料金として使用。中国の祝日を除く月〜金のUTC 01:00〜04:00・06:00〜10:00に適用。その他の時間帯・土日・中国祝日は半額(入力0.66、出力1.98、キャッシュ読取0.022)。入力はcache miss、cacheはcache hit。モデルID deepseek-v4-pro、対応版DeepSeek-V4-Pro-0813。時間帯の異なる料金を平均・混合しない。(確認日 2026-09-30) DeepSeek API pricing
DeepSeek V4 Pro 0813 / DeepSeek APIcache: 0.044 USD / 1M tokens
条件・出典
DeepSeek APIのピーク料金(USD/100万トークン)を代表料金として使用。中国の祝日を除く月〜金のUTC 01:00〜04:00・06:00〜10:00に適用。その他の時間帯・土日・中国祝日は半額(入力0.66、出力1.98、キャッシュ読取0.022)。入力はcache miss、cacheはcache hit。モデルID deepseek-v4-pro、対応版DeepSeek-V4-Pro-0813。時間帯の異なる料金を平均・混合しない。(確認日 2026-09-30) DeepSeek API pricing