Nvidiaの新研究によると、同じClaude Opus 5でもハーネス(周辺の仕組み)次第でARC-AGI-3のスコアが30%から100%まで跳ね上がりました。記憶の持たせ方や監督役エージェントの追加が鍵で、OpenAIも似た経験からスコアを3倍にしています。モデル選び以上に使い方の設計が問われる時代です。
〇AIコーディングの新時代到来:Cursor 2.0が実現する「マルチエージェント開発」の衝撃(2025年11月10日)
https://note.com/ai_curator/n/ne2cdf8154d6d
〇NVIDIA AVO Reaches 100% on ARC-AGI-3(2026年8月21日)
https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
〇How enabling two settings tripled our scores on the ARC-AGI-3 benchmark(2026年7月29日)
https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
〇Benchmarking Coding Agents: Insights from Databricks' Multi-Million Line Codebase(2026年7月)
https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase
#生成AIキュレーター #生成AIキュレーション #Nvidia #ARCAGI3 #AIエージェント #ハーネス #ClaudeOpus5 #OpenAI #GPT5.6 #Databricks #AIベンチマーク #エージェントハーネス #長期タスク #AI開発 #生成AI活用 #agenticAI #AVO #マルチエージェント #AIコスト #テック業界 #AI最新動向 #システム設計 #AIツール選定 #開発生産性 #AI業務活用
感想
まだ感想はありません。最初の1件を書きましょう!