SWE-bench の検索結果
ローカルLLM活用術:ローカルLLM導入完全ガイド2026:選定と機密保護(用途別モデルの選び方)
…Dense)18–20 GBApache 2.024GB GPUでの決定版。SWE-benchで高いスコアを記録。Gemma 4マルチモーダル・法務遵守31B (MoE系)6GB…
ローカルLLM活用術:ローカルLLM導入完全ガイド2026:選定と機密保護
…開発約18–20 GBApache 2.02026年4月22日リリース。SWE-bench Verifiedで77.2%を記録し、超大型モデルを凌駕…
名古屋ではたらく社長のITニュ..
Ep.1425 Microsoft、推論特化型モデル「MAI-Thinking-1」を発表──クリーンデータが牽引するエンタープライズAIの新戦略(2026年8月20日配信)
…が多く、ソフトウェアエンジニアリングのベンチマークであるSWE-Bench Proにおいて業界の最先端モデルと同等のスコアを記録しました。さらに…
AI What's Up News
2026-07-11 AIニュース
…トピック: 1. OpenAIが「SWE-Bench Proの約30%が壊れている」と報告、AIのコーディング能力を測るベンチマークに大量の不備 2…
名古屋ではたらく社長のITニュ..
Ep.1350 SpaceXAIが最新モデル「Grok 4.5」を発表──Cursor買収で強化されたコーディングと業務エージェント機能(2026年7月9日配信)
…規模で並列稼働された。SWE Bench Pro: AIのソフトウェアエンジニアリング能力を評価する主要なベンチマーク指標。それでは解説に入ります…
AIがAIのニュースを語る番組
Claude Fable 5、利用再開——「一日で終わる2ヶ月分の仕事」は本物だったのか
…に再開されました。本モデルはSWE-Bench Proで80.3%を記録する高いコーディング能力を持ち、人間のチームが2ヶ月…
AIニュース速報
【6/27 10時】アンソロピック「ミソス5」利用制限を一部解除・アップルがマック・アイパッド値上げ、AIメモリ不足が理由
…コーディングAIのベンチマーク点数水増しを指摘 https://www.marktechpost.com/2026/06/26/cursor-study-finds-reward-hacking-inflates-coding-agent-benchmark-scores-on-swe-bench-pro/
AIクエスト(今日から始めるAI..
◆【日刊】26/6/12 最新AIトレンド情報サマリー →AIが自分でAIを作る「再帰的自己改善」時代が到来、Claude Mythosが人間の52倍の速さでAI開発タスクを完了
…を完了・AnthropicのCEOが航空機並みの政府規制とベーシックインカムを提言・Claude Fable 5がSWE-Bench Proで80.3%を記録…
AIクエスト(今日から始めるAI..
◆【日刊】26/6/10 最新AIトレンド情報サマリー →Claude Fable 5公開、SWE-bench Proで80.3%を達成しSOTA更新
…SWE-bench Proで80.3%を達成しSOTA更新 AIクエスト(今日から始めるAI生活) ◆ 【日刊】26/6/10最新AIトレンド情報サマリー…
42【圧倒的性能】Claude Fable 5のファーストインプレッション
42【圧倒的性能】Claude Fable 5のファーストインプレッション こんにちは、AI駆動開発部の日常へようこそ。 このポッドキャストは、日々AI駆動開発を…
名古屋ではたらく社長のITニュ..
Ep.1271 Microsoftの逆襲──独自開発の推論モデル「MAI-Thinking-1」が示す“クリーンなAI”の未来(2026年6月4日配信)
…これにより、ソフトウェア開発の難関ベンチマークである「SWE-Bench Pro」において、Anthropic社の最高峰モデルであるClaude Opus 4.6に…
AIクエスト(今日から始めるAI..
◆【日刊】26/6/1 最新AIトレンド情報サマリー →Anthropicが時価総額9,650億ドルでOpenAIを超え世界一のAIスタートアップに
…5.6倍高速化、SWE-bench Pro 59%達成・NVIDIAがRTX Spark発表:1ペタフロップスのローカルAI PC、Windowsを自律エージェントの相棒へ・GitHub…
名古屋ではたらく社長のITニュ..
Ep.1244 Datacurveが放つ刺客「DeepSWE」──AIコーディング評価を揺るがす新ベンチマークの衝撃(2026年5月28日配信)
…実務に近い評価環境を提供する。SWE-Bench: これまでAI業界で標準的に使われてきた、ソフトウェアエンジニアリングの能力を測るベンチ…
名古屋ではたらく社長のITニュ..
Ep.1162 Mistral AI、リモートエージェント「Vibe」と新モデル「Medium 3.5」を発表──自律型AIが変える開発現場(2026年5月7日配信)
…で高精度にこなす。SWE-bench: AIが実際のソフトウェア開発の課題をどれだけ自動で解決できるかを測定する、業界標準の評価…
AIニュース速報
【4/29 16時】DeepSeek V4 launch + Huawei chip rush・Goldman Sachs bans Anthropic Claude in Hong Kong
…https://www.marktechpost.com/2026/04/28/poolside-ai-introduces-laguna-xs-2-and-m-1-agentic-coding-models-reaching-68-2-and-72-5-on-swe-bench-verified/ 4…
AIニュース速報
【4/29 15時】ゴールドマンサックス香港バンカーアンソロピック使用禁止・ピュアDC湾岸データセンター投資停止
…https://www.marktechpost.com/2026/04/28/poolside-ai-introduces-laguna-xs-2-and-m-1-agentic-coding-models-reaching-68-2-and-72-5-on-swe-bench-verified/ 4…
名古屋ではたらく社長のITニュ..
Ep.1126 アリババの最強モデル「Qwen3.6-Max-Preview」登場──AI開発競争を牽引する自律型コーディングの進化(2026年4月23日配信)
…な向上です。アリババの公式発表によりますと、この新モデルは「SWE-bench Pro」や「Terminal-Bench 2.0」、「SciCode」といった、世界的に…
AIクエスト(今日から始めるAI..
◆【日刊】26/4/21 最新AIトレンド情報サマリー →GitHub Copilot ProプランがClaude Opusを排除、新規登録も一時停止
…停止・AnthropicがAmazonと5GW確保の超大型提携を拡大・Kimi K2.6がSWE-Bench Proでオープンソース最高記録58.6%・Claude…
名古屋ではたらく社長のITニュ..
Ep.1079 Cognitionが放つ新たなプログラミング特化AI──「SWE-1.6」が切り拓く超高速・高精度な開発の未来(2026年4月9日配信)
…驚異的な処理速度を維持しながら、ソフトウェア開発の実務能力を測る「SWE-Bench Pro」において、従来比で11パーセントも高い…
名古屋ではたらく社長のITニュ..
Ep.965 OpenAIが告げるベンチマークの終焉──「SWE-bench Verified」の評価終了が意味するAIの急進化(2026年2月26日配信)
Ep.965 OpenAIが告げるベンチマークの終焉──「SWE-bench Verified」の評価終了が意味するAIの急進化(2026年2月26日…