閲覧フィルタ(許可リスト)
以下のモデル名だけを表示。数値の発明・別取得はせず、各正本スナップショットに存在する行だけを使用。
- GPT-5.6 Sol
- GPT-5.6 Terra
- GPT-5.6 Luna
- GPT-6 Astra
- GPT-6 Sol
- GPT-6 Luna
- Grok 4.6
- Grok 4.7
DeepSeek(ソース別)
- AutomationBench: DeepSeek V4 Flash
- DeepSWE: DeepSeek V4 Flash, DeepSeek V4 Pro
- Artificial Analysis: DeepSeek V4 Flash Vision, DeepSeek V4 Pro
- CursorBench: DeepSeekなし(描画しない)
上の許可リストは既存4チャートのみ。VulcanBench Frontier v4 と VulcanBench SWE v3 は許可リストを適用せず、それぞれのスナップショットで score と cost が両方ある行をすべて表示する。2つは別グラフで、点数は混ぜない。
凡例タップでシリーズ表示切替。点をタップすると詳細(モデル / effort / score / コスト)。
Artificial Analysis
Artificial Analysis Intelligence Index (0–100) · as_of 2026-09-24
実際にプロット(36点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, GPT-6 Sol, GPT-6 Luna, Grok 4.6, Grok 4.7, DeepSeek V4 Flash Vision
スナップショットにない許可項目: なし
有効な score/cost がなく非プロット: DeepSeek V4 Pro
コスト比矢印: GPT-6 Luna→GPT-6 Sol: ×15.1 (Δscore +11) / GPT-6 Sol→GPT-6 Astra: ×3.1 (Δscore +5)
Artificial Analysis · as_of 2026-09-24 · https://artificialanalysis.ai/models
DeepSWE
Pass@1 % · as_of 2026-09-22
実際にプロット(26点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, Grok 4.6, DeepSeek V4 Flash, DeepSeek V4 Pro
スナップショットにない許可項目: GPT-6 Luna, GPT-6 Sol, Grok 4.7
有効な score/cost がなく非プロット: なし
コスト比矢印: このソースでは GPT-6 Luna→Sol→Astra の両端が揃わないため非表示
DeepSWE · as_of 2026-09-22 · https://deepswe.datacurve.ai/artifacts/v1.1/leaderboard-live.json
CursorBench
CursorBench 4.0 Correctness % · as_of 2026-09-23
実際にプロット(23点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Grok 4.6, Grok 4.7
スナップショットにない許可項目: GPT-6 Astra, GPT-6 Luna, GPT-6 Sol
有効な score/cost がなく非プロット: なし
DeepSeek: このソースのスナップショットに行なし(描画しない)
コスト比矢印: このソースでは GPT-6 Luna→Sol→Astra の両端が揃わないため非表示
CursorBench · as_of 2026-09-23 · https://cursor.com/cursorbench
AutomationBench
Zapier AutomationBench task_completed_correctly % (LB v1.0.6) · as_of 2026-09-24
実際にプロット(37点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, GPT-6 Sol, GPT-6 Luna, DeepSeek V4 Flash
スナップショットにない許可項目: Grok 4.6, Grok 4.7
有効な score/cost がなく非プロット: なし
コスト比矢印: GPT-6 Luna→GPT-6 Sol: ×8.5 (Δscore +11.3) / GPT-6 Sol→GPT-6 Astra: ×5.1 (Δscore +9.4)
AutomationBench · as_of 2026-09-24 · https://zapier.com/benchmarks
VulcanBench Frontier v4
Combined score (50% functional correctness, 8.5% lint and complexity, 8.5% security, 33% code quality) · as_of 2026-10-02
実際にプロット(49点): Fable 5.1, Opus 5.5, GPT-6 Astra, GPT-5.6 Terra, GPT-6.1 Sol, GPT-5.6 Sol, GPT-6 Sol, GPT-5.6 Luna, GPT-6 Luna, GPT-5.5
有効な score/cost がなく非プロット: なし
API-equivalent $/task at list rates from solver receipts. Every model ran on a subscription. This is not the subscription bill.
Frontier v4 は、以前 VulcanBench-SWE v4 と呼ばれていた同じ課題セットです。SWE v3 の次の世代、という読みはできますが、サイトは後継とは書いていません。点数に互換性はなく、SWE v3 とは別のグラフです。
Morgan Linton のカード(2026-10-03)の総合点は、このグラフの GPT-6.1 Sol・Opus 5.5・GPT-6 Astra と同じなので点は足していません。通過数(23問中)、1問あたりの分数、コード品質は、その3モデルの点をタップしたときだけ出します。線には混ぜていません。80台前半、85〜90、90超は本人の使い方の目安で、実測の境界ではないので線は引いていません。
コスト比矢印: GPT-6 Luna→GPT-6 Sol: ×25.2 (Δscore +5.4) / GPT-6 Sol→GPT-6 Astra: ×1.0 (Δscore +2.48)
VulcanBench Frontier v4 · as_of 2026-10-02 · https://vulcanbench.com/leaderboard.html
VulcanBench SWE v3
pass@1 percent (mean per-task success rate). Not the Frontier v4 combined score. · as_of 2026-10-02
実際にプロット(42点): Grok 4.5, Claude Fable 5, DeepSeek V4-Flash, DeepSeek V4 Pro, GPT-5.6 Terra, Muse Spark 1.2, Claude Opus 5, Grok 4.6, GPT-5.6 Sol, GPT-5.6 Luna, Qwen3.8-27B, Qwen3.8-Max, GLM 5.3, Claude Haiku 4.5, Kimi K3
有効な score/cost がなく非プロット: なし
usd_per_task_run: total list-price API spend for the column divided by runs. Not a subscription bill, and not the Frontier v4 solver-receipt $/task.
SWE v3 / Eval Suite 3 only. The site says these scores are not comparable with Frontier v4. Harness is not a column on this board; some reports measure the same model in more than one harness and those splits are not in this file. GLM 5.3 ZCode-harness result (87.0% at max) is excluded by the source.
コスト比矢印: このソースでは GPT-6 Luna→Sol→Astra の両端が揃わないため非表示
VulcanBench SWE v3 · as_of 2026-10-02 · https://vulcanbench.com/leaderboard.json