モデル比較 · インタラクティブ(5ソース)

X = cost_per_task_usd(対数) / Y = score。線は effort 弱→強。score または cost が null の点はプロットしない。正本JSONは読み取りのみ。

チャート間でスコアは比較できない。

閲覧フィルタ(許可リスト)

以下のモデル名だけを表示。数値の発明・別取得はせず、各正本スナップショットに存在する行だけを使用。

DeepSeek(ソース別)

上の許可リストは既存4チャートのみ。VulcanBench Frontier v4 は許可リストを適用せず、そのスナップショットで score と cost が両方ある行をすべて表示する。

ファミリー:

凡例タップでシリーズ表示切替。点をタップすると詳細(モデル / effort / score / コスト)。

Artificial Analysis

Artificial Analysis Intelligence Index (0–100) · as_of 2026-09-24

as_of 2026-09-24 · Artificial Analysis Intelligence Index (0–100) · https://artificialanalysis.ai/models

実際にプロット(36点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, GPT-6 Sol, GPT-6 Luna, Grok 4.6, Grok 4.7, DeepSeek V4 Flash Vision

スナップショットにない許可項目: なし
有効な score/cost がなく非プロット: DeepSeek V4 Pro

コスト比矢印: GPT-6 Luna→GPT-6 Sol: ×15.1 (Δscore +11) / GPT-6 Sol→GPT-6 Astra: ×3.1 (Δscore +5)

Artificial Analysis · as_of 2026-09-24 · https://artificialanalysis.ai/models

DeepSWE

Pass@1 % · as_of 2026-09-22

as_of 2026-09-22 · Pass@1 % · https://deepswe.datacurve.ai/artifacts/v1.1/leaderboard-live.json

実際にプロット(26点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, Grok 4.6, DeepSeek V4 Flash, DeepSeek V4 Pro

スナップショットにない許可項目: GPT-6 Luna, GPT-6 Sol, Grok 4.7
有効な score/cost がなく非プロット: なし

コスト比矢印: このソースでは GPT-6 Luna→Sol→Astra の両端が揃わないため非表示

DeepSWE · as_of 2026-09-22 · https://deepswe.datacurve.ai/artifacts/v1.1/leaderboard-live.json

CursorBench

CursorBench 4.0 Correctness % · as_of 2026-09-23

as_of 2026-09-23 · CursorBench 4.0 Correctness % · https://cursor.com/cursorbench

実際にプロット(23点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Grok 4.6, Grok 4.7

スナップショットにない許可項目: GPT-6 Astra, GPT-6 Luna, GPT-6 Sol
有効な score/cost がなく非プロット: なし

DeepSeek: このソースのスナップショットに行なし(描画しない)

コスト比矢印: このソースでは GPT-6 Luna→Sol→Astra の両端が揃わないため非表示

CursorBench · as_of 2026-09-23 · https://cursor.com/cursorbench

AutomationBench

Zapier AutomationBench task_completed_correctly % (LB v1.0.6) · as_of 2026-09-24

as_of 2026-09-24 · Zapier AutomationBench task_completed_correctly % (LB v1.0.6) · https://zapier.com/benchmarks

実際にプロット(37点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, GPT-6 Sol, GPT-6 Luna, DeepSeek V4 Flash

スナップショットにない許可項目: Grok 4.6, Grok 4.7
有効な score/cost がなく非プロット: なし

コスト比矢印: GPT-6 Luna→GPT-6 Sol: ×8.5 (Δscore +11.3) / GPT-6 Sol→GPT-6 Astra: ×5.1 (Δscore +9.4)

AutomationBench · as_of 2026-09-24 · https://zapier.com/benchmarks

VulcanBench Frontier v4

Combined score (50% functional correctness, 8.5% lint and complexity, 8.5% security, 33% code quality) · as_of 2026-10-02

as_of 2026-10-02 · Combined score (50% functional correctness, 8.5% lint and complexity, 8.5% security, 33% code quality) · https://vulcanbench.com/leaderboard.html

実際にプロット(49点): Fable 5.1, Opus 5.5, GPT-6 Astra, GPT-5.6 Terra, GPT-6.1 Sol, GPT-5.6 Sol, GPT-6 Sol, GPT-5.6 Luna, GPT-6 Luna, GPT-5.5

有効な score/cost がなく非プロット: なし

API-equivalent $/task at list rates from solver receipts. Every model ran on a subscription. This is not the subscription bill.

Frontier v4 は、以前 VulcanBench-SWE v4 と呼ばれていた同じ課題セットです。SWE v3 の次の世代、という読みはできますが、サイトは後継とは書いていません。点数に互換性はなく、SWE v3 とは別のグラフです。

コスト比矢印: GPT-6 Luna→GPT-6 Sol: ×25.2 (Δscore +5.4) / GPT-6 Sol→GPT-6 Astra: ×1.0 (Δscore +2.48)

VulcanBench Frontier v4 · as_of 2026-10-02 · https://vulcanbench.com/leaderboard.html