SWE-bench の検索結果

Ep.936 上場直後の“本気”──MiniMax「M2.5」が書き換えるAIのコスト対効果(2026年2月19日配信)

Ep.936 上場直後の“本気”──MiniMax「M2.5」が書き換えるAIのコスト対効果(2026年2月19日配信)

…発表されたスペックによると、M2.5はコーディング能力を測る「SWE-Bench」において、米Anthropic社のClaude Opus 4.6やOpenAI…

Ep.937 OpenAIの電撃戦──「GPT-5.3 Spark」が刻む“1000トークン/秒”の衝撃(2026年2月19日配信)

Ep.937 OpenAIの電撃戦──「GPT-5.3 Spark」が刻む“1000トークン/秒”の衝撃(2026年2月19日配信)

…マークテストの結果も興味深いものです。複雑なエンジニアリング課題を解く「SWE-Bench Pro」において、Sparkの正答率は兄貴分にわずか…

Ep.877 Qwen3-Max Thinking──Alibabaが解き放つ“オンデマンド思考”とシリコンバレーへの挑戦状(2026年1月29日配信)

Ep.877 Qwen3-Max Thinking──Alibabaが解き放つ“オンデマンド思考”とシリコンバレーへの挑戦状(2026年1月29日配信)

…されたベンチマーク結果も衝撃的です。競技プログラミングの指標であるSWE-Bench Verifiedでは、ライバルたちを抑えてトップスコアを記録…

Ep.811 Z.ai「GLM-4.7」リリース──中国発“思考する”コーディングAIの衝撃(2025年12月25日配信)

Ep.811 Z.ai「GLM-4.7」リリース──中国発“思考する”コーディングAIの衝撃(2025年12月25日配信)

…ベンチマークスコアも衝撃的です。難関とされる「SWE-bench」や「HLE」において、GLM-4.7はGPT-5.2やClaude 4.5 Sonnet…

Ep.790 Xiaomi「MiMo-V2-Flash」──スマホで動く“プログラマーAI”の衝撃(2025年12月18日配信)

Ep.790 Xiaomi「MiMo-V2-Flash」──スマホで動く“プログラマーAI”の衝撃(2025年12月18日配信)

…すべきは、そのコーディング能力です。ソフトウェアエンジニアリングのベンチマークテスト「SWE-bench Verified」で、オープンソースモデルとして世界1位を獲得。有料の…

⁠⁠◆【日刊】25/12/1 最新AIトレンド情報サマリー⁠⁠⁠⁠⁠⁠⁠⁠⁠⁠ →Microsoft Copilot 30%値下げ、中小企業AI導入加速

⁠⁠◆【日刊】25/12/1 最新AIトレンド情報サマリー⁠⁠⁠⁠⁠⁠⁠⁠⁠⁠ →Microsoft Copilot 30%値下げ、中小企業AI導入加速

…自動証明・Claude Opus 4.5、ソフトウェア開発で人間超え(SWE-bench 80.9%)・Microsoft Copilot 30%値下げ、中小企業AI導入加速・Adobe Firefly無制限生成…

Ep.712 Gemini 3始動──“Deep Think”とAntigravityでエージェント時代を押し出す(2025年11月20日配信)

Ep.712 Gemini 3始動──“Deep Think”とAntigravityでエージェント時代を押し出す(2025年11月20日配信)

…2.0で54.2%、SWE-bench Verifiedで76.2%を示し、ゼロショットからの“Vibe Coding”でリッチなUIや3D表現を…

Ep.689 Kimi K2 Thinking──“考えるエージェント”は何が新しいのか(2025年11月13日配信)

Ep.689 Kimi K2 Thinking──“考えるエージェント”は何が新しいのか(2025年11月13日配信)

…の公開モデルを上回る指標を複数提示しています。SWE-benchのような実コード課題でも、ツール前提の検証で70…

Ep.613 Anthropic「Claude Sonnet 4.5」発表──30時間“自走”でチャットアプリを作る時代へ(2025年10月2日配信)

Ep.613 Anthropic「Claude Sonnet 4.5」発表──30時間“自走”でチャットアプリを作る時代へ(2025年10月2日配信)

…性能面では、ソフトウェア実務の修正力を測るSWE-bench Verifiedで最先端、実機操作系ベンチのOSWorldでも61.4%でトップ…

Ep.602 OpenAI「GDPval」発表──44職種の“実務タスク”でAIはどこまで通用するのか(2025年10月2日配信)

Ep.602 OpenAI「GDPval」発表──44職種の“実務タスク”でAIはどこまで通用するのか(2025年10月2日配信)

…学術色の強いMMLUや、実務寄りのSWE-Bench・MLE-Bench、そして市場連動型のSWE-Lancerと続いてきた“現実に寄せる評価”の…

Ep.573 Codex大幅アップグレード──「GPT-5-Codex」で“任せられるコーディング相棒”へ(2025年9月18日配信)

Ep.573 Codex大幅アップグレード──「GPT-5-Codex」で“任せられるコーディング相棒”へ(2025年9月18日配信)

…使い分けが示されました。SWE-bench Verifiedの報告も全500課題に拡張されています。製品としてのCodex…

Ep.429 GPT-5、コードを書く――「開発者体験」を塗り替える次世代LLMの実力(2025年7月31日配信)

Ep.429 GPT-5、コードを書く――「開発者体験」を塗り替える次世代LLMの実力(2025年7月31日配信)

…上がっています。同記事は詳細スコアを伏せつつも「SWE-bench Verifiedで大幅な向上が確認された」と示唆しました。

Ep.381 Mistral「Devstral」刷新――24BでSWE最強、API版はGPT-4.1を四分の一コストで抜く(2025年7月17日配信)

Ep.381 Mistral「Devstral」刷新――24BでSWE最強、API版はGPT-4.1を四分の一コストで抜く(2025年7月17日配信)

…4Bという“片手GPU”規模ながら、SWE-Bench Verifiedで53.6 %を記録し、これまでオープンソース首位だったDeepSeek V3やGemma 3…