モデル比較 · インタラクティブ(6ソース)

X = cost_per_task_usd(対数) / Y = score。線は effort 弱→強。score または cost が null の点はプロットしない。正本JSONは読み取りのみ。

チャート間でスコアは比較できない。

閲覧フィルタ(許可リスト)

以下のモデル名だけを表示。数値の発明・別取得はせず、各正本スナップショットに存在する行だけを使用。

DeepSeek(ソース別)

上の許可リストは既存4チャートのみ。VulcanBench Frontier v4 と VulcanBench SWE v3 は許可リストを適用せず、それぞれのスナップショットで score と cost が両方ある行をすべて表示する。2つは別グラフで、点数は混ぜない。

ファミリー:

凡例タップでシリーズ表示切替。点をタップすると詳細(モデル / effort / score / コスト)。

Artificial Analysis

Artificial Analysis Intelligence Index (0–100) · as_of 2026-09-24

as_of 2026-09-24 · Artificial Analysis Intelligence Index (0–100) · https://artificialanalysis.ai/models

実際にプロット(36点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, GPT-6 Sol, GPT-6 Luna, Grok 4.6, Grok 4.7, DeepSeek V4 Flash Vision

スナップショットにない許可項目: なし
有効な score/cost がなく非プロット: DeepSeek V4 Pro

コスト比矢印: GPT-6 Luna→GPT-6 Sol: ×15.1 (Δscore +11) / GPT-6 Sol→GPT-6 Astra: ×3.1 (Δscore +5)

Artificial Analysis · as_of 2026-09-24 · https://artificialanalysis.ai/models

DeepSWE

Pass@1 % · as_of 2026-09-22

as_of 2026-09-22 · Pass@1 % · https://deepswe.datacurve.ai/artifacts/v1.1/leaderboard-live.json

実際にプロット(26点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, Grok 4.6, DeepSeek V4 Flash, DeepSeek V4 Pro

スナップショットにない許可項目: GPT-6 Luna, GPT-6 Sol, Grok 4.7
有効な score/cost がなく非プロット: なし

コスト比矢印: このソースでは GPT-6 Luna→Sol→Astra の両端が揃わないため非表示

DeepSWE · as_of 2026-09-22 · https://deepswe.datacurve.ai/artifacts/v1.1/leaderboard-live.json

CursorBench

CursorBench 4.0 Correctness % · as_of 2026-09-23

as_of 2026-09-23 · CursorBench 4.0 Correctness % · https://cursor.com/cursorbench

実際にプロット(23点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Grok 4.6, Grok 4.7

スナップショットにない許可項目: GPT-6 Astra, GPT-6 Luna, GPT-6 Sol
有効な score/cost がなく非プロット: なし

DeepSeek: このソースのスナップショットに行なし(描画しない)

コスト比矢印: このソースでは GPT-6 Luna→Sol→Astra の両端が揃わないため非表示

CursorBench · as_of 2026-09-23 · https://cursor.com/cursorbench

AutomationBench

Zapier AutomationBench task_completed_correctly % (LB v1.0.6) · as_of 2026-09-24

as_of 2026-09-24 · Zapier AutomationBench task_completed_correctly % (LB v1.0.6) · https://zapier.com/benchmarks

実際にプロット(37点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, GPT-6 Sol, GPT-6 Luna, DeepSeek V4 Flash

スナップショットにない許可項目: Grok 4.6, Grok 4.7
有効な score/cost がなく非プロット: なし

コスト比矢印: GPT-6 Luna→GPT-6 Sol: ×8.5 (Δscore +11.3) / GPT-6 Sol→GPT-6 Astra: ×5.1 (Δscore +9.4)

AutomationBench · as_of 2026-09-24 · https://zapier.com/benchmarks

VulcanBench Frontier v4

Combined score (50% functional correctness, 8.5% lint and complexity, 8.5% security, 33% code quality) · as_of 2026-10-02

as_of 2026-10-02 · Combined score (50% functional correctness, 8.5% lint and complexity, 8.5% security, 33% code quality) · https://vulcanbench.com/leaderboard.html

実際にプロット(49点): Fable 5.1, Opus 5.5, GPT-6 Astra, GPT-5.6 Terra, GPT-6.1 Sol, GPT-5.6 Sol, GPT-6 Sol, GPT-5.6 Luna, GPT-6 Luna, GPT-5.5

有効な score/cost がなく非プロット: なし

API-equivalent $/task at list rates from solver receipts. Every model ran on a subscription. This is not the subscription bill.

Frontier v4 は、以前 VulcanBench-SWE v4 と呼ばれていた同じ課題セットです。SWE v3 の次の世代、という読みはできますが、サイトは後継とは書いていません。点数に互換性はなく、SWE v3 とは別のグラフです。

Morgan Linton のカード(2026-10-03)の総合点は、このグラフの GPT-6.1 Sol・Opus 5.5・GPT-6 Astra と同じなので点は足していません。通過数(23問中)、1問あたりの分数、コード品質は、その3モデルの点をタップしたときだけ出します。線には混ぜていません。80台前半、85〜90、90超は本人の使い方の目安で、実測の境界ではないので線は引いていません。

コスト比矢印: GPT-6 Luna→GPT-6 Sol: ×25.2 (Δscore +5.4) / GPT-6 Sol→GPT-6 Astra: ×1.0 (Δscore +2.48)

VulcanBench Frontier v4 · as_of 2026-10-02 · https://vulcanbench.com/leaderboard.html

VulcanBench SWE v3

pass@1 percent (mean per-task success rate). Not the Frontier v4 combined score. · as_of 2026-10-02

as_of 2026-10-02 · pass@1 percent (mean per-task success rate). Not the Frontier v4 combined score. · https://vulcanbench.com/leaderboard.json

実際にプロット(42点): Grok 4.5, Claude Fable 5, DeepSeek V4-Flash, DeepSeek V4 Pro, GPT-5.6 Terra, Muse Spark 1.2, Claude Opus 5, Grok 4.6, GPT-5.6 Sol, GPT-5.6 Luna, Qwen3.8-27B, Qwen3.8-Max, GLM 5.3, Claude Haiku 4.5, Kimi K3

有効な score/cost がなく非プロット: なし

usd_per_task_run: total list-price API spend for the column divided by runs. Not a subscription bill, and not the Frontier v4 solver-receipt $/task.

SWE v3 / Eval Suite 3 only. The site says these scores are not comparable with Frontier v4. Harness is not a column on this board; some reports measure the same model in more than one harness and those splits are not in this file. GLM 5.3 ZCode-harness result (87.0% at max) is excluded by the source.

コスト比矢印: このソースでは GPT-6 Luna→Sol→Astra の両端が揃わないため非表示

VulcanBench SWE v3 · as_of 2026-10-02 · https://vulcanbench.com/leaderboard.json