閲覧フィルタ(許可リスト)
以下のモデル名だけを表示。数値の発明・別取得はせず、各正本スナップショットに存在する行だけを使用。
- GPT-5.6 Sol
- GPT-5.6 Terra
- GPT-5.6 Luna
- GPT-6 Astra
- GPT-6 Sol
- GPT-6 Luna
- Grok 4.6
- Grok 4.7
- Opus 5.5
- Opus 5
- Haiku 5.5
- Claude Opus 5
DeepSeek(ソース別)
- AutomationBench: DeepSeek V4 Flash
- DeepSWE: DeepSeek V4 Flash, DeepSeek V4 Pro
- Artificial Analysis: DeepSeek V4.1 Flash, DeepSeek V4 Pro
- CursorBench: DeepSeekなし(描画しない)
上の許可リストは既存4チャートのみ。VulcanBench Frontier v4 と VulcanBench SWE v3 は許可リストを適用せず、それぞれのスナップショットで score と cost が両方ある行をすべて表示する。2つは別グラフで、点数は混ぜない。
凡例タップでシリーズ表示切替。点をタップすると詳細(モデル / effort / score / コスト)。
Artificial Analysis
Artificial Analysis Intelligence Index (0–100) · as_of 2026-10-10
実際にプロット(53点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, GPT-6 Sol, GPT-6 Luna, Grok 4.6, Grok 4.7, Haiku 5.5, Opus 5.5, DeepSeek V4.1 Flash
スナップショットにない許可項目: Claude Opus 5, Opus 5
有効な score/cost がなく非プロット: DeepSeek V4 Pro
Artificial Analysis · as_of 2026-10-10 · https://artificialanalysis.ai/models
DeepSWE
Pass@1 % · as_of 2026-09-22
実際にプロット(31点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, Grok 4.6, Claude Opus 5, DeepSeek V4 Flash, DeepSeek V4 Pro
スナップショットにない許可項目: GPT-6 Luna, GPT-6 Sol, Grok 4.7, Haiku 5.5, Opus 5, Opus 5.5
有効な score/cost がなく非プロット: なし
DeepSWE · as_of 2026-09-22 · https://deepswe.datacurve.ai/artifacts/v1.1/leaderboard-live.json
CursorBench
CursorBench 4.0 Correctness % · as_of 2026-10-10
実際にプロット(38点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Grok 4.6, Grok 4.7, Haiku 5.5, Opus 5.5, Opus 5
スナップショットにない許可項目: Claude Opus 5, GPT-6 Astra, GPT-6 Luna, GPT-6 Sol
有効な score/cost がなく非プロット: なし
DeepSeek: このソースのスナップショットに行なし(描画しない)
CursorBench · as_of 2026-10-10 · https://cursor.com/cursorbench
AutomationBench
Zapier AutomationBench task_completed_correctly % (LB v1.0.6) · as_of 2026-10-10
実際にプロット(37点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, GPT-6 Sol, GPT-6 Luna, DeepSeek V4 Flash
スナップショットにない許可項目: Claude Opus 5, Grok 4.6, Grok 4.7, Haiku 5.5, Opus 5, Opus 5.5
有効な score/cost がなく非プロット: なし
AutomationBench · as_of 2026-10-10 · https://zapier.com/benchmarks
VulcanBench Frontier v4
Combined score (50% functional correctness, 8.5% lint and complexity, 8.5% security, 33% code quality) · as_of 2026-10-02
実際にプロット(49点): Fable 5.1, Opus 5.5, GPT-6 Astra, GPT-5.6 Terra, GPT-6.1 Sol, GPT-5.6 Sol, GPT-6 Sol, GPT-5.6 Luna, GPT-6 Luna, GPT-5.5
有効な score/cost がなく非プロット: なし
API-equivalent $/task at list rates from solver receipts. Every model ran on a subscription. This is not the subscription bill.
Frontier v4 は、以前 VulcanBench-SWE v4 と呼ばれていた同じ課題セットです。SWE v3 の次の世代、という読みはできますが、サイトは後継とは書いていません。点数に互換性はなく、SWE v3 とは別のグラフです。
Morgan Linton のカード(2026-10-03)の総合点は、このグラフの GPT-6.1 Sol・Opus 5.5・GPT-6 Astra と同じなので点は足していません。通過数(23問中)、1問あたりの分数、コード品質は、その3モデルの点をタップしたときだけ出します。線には混ぜていません。80台前半、85〜90、90超は本人の使い方の目安で、実測の境界ではないので線は引いていません。
VulcanBench Frontier v4 · as_of 2026-10-02 · https://vulcanbench.com/leaderboard.html
VulcanBench SWE v3
pass@1 percent (mean per-task success rate). Not the Frontier v4 combined score. · as_of 2026-10-02
実際にプロット(42点): Grok 4.5, Claude Fable 5, DeepSeek V4-Flash, DeepSeek V4 Pro, GPT-5.6 Terra, Muse Spark 1.2, Claude Opus 5, Grok 4.6, GPT-5.6 Sol, GPT-5.6 Luna, Qwen3.8-27B, Qwen3.8-Max, GLM 5.3, Claude Haiku 4.5, Kimi K3
有効な score/cost がなく非プロット: なし
usd_per_task_run: total list-price API spend for the column divided by runs. Not a subscription bill, and not the Frontier v4 solver-receipt $/task.
SWE v3 / Eval Suite 3 only. The site says these scores are not comparable with Frontier v4. Harness is not a column on this board; some reports measure the same model in more than one harness and those splits are not in this file. GLM 5.3 ZCode-harness result (87.0% at max) is excluded by the source.
VulcanBench SWE v3 · as_of 2026-10-02 · https://vulcanbench.com/leaderboard.json