高度な推論能力を持つAIモデルを効率的に構築する手法を解説しています。研究チームは、品質・難易度・多様性を重視して厳選された1,000件の学習データ「s1K」を用い、わずか26分の微調整で強力なモデル「s1-32B」を開発しました。このモデルは、思考プロセスを強制的に延長する「予算強制(budget forcing)」という新しい手法により、推論時間を増やすほど正答率が向上するテストタイム・スケーリングを実現しています。その結果、膨大なデータで学習された既存モデルに匹敵する性能を、極めて少ない計算リソースで達成しました。本研究は、推論データの質が量よりも重要であることを示し、AIの思考プロセスを制御する新たな可能性を提示しています。
感想
まだ感想はありません。最初の1件を書きましょう!
スクロール