自己進化ハーネスの仕組みと成果
みなさん、こんにちは。The Signal Shift by A.I.R. Labs。ナビゲーターの林です。
この番組はSpotifyやApple Podcastなどで配信しています。
日々、刻々と変化するAIの最先端トレンドと大きな変化のシグナルを読み解き、
ビジネスや日常にどう影響するか、初心者にも分かりやすくお届けする番組です。
本日は、AI自身の進化とマルチエージェントのリスクについて深掘りしていきますよ。
貝さん、よろしくお願いします。
こんにちは、貝です。本日は、AIが自分の実行環境を書き換える自己進化、
AI同士の対話で起きる過激化、そしてシミュレーション用の仮想の人々を作るフレームワーク
という三つのシグナルを取り上げます。実は最初の二つは地続きです。
自分を書き換えるAIが増え、AI同士がやり取りする場面も増えると、
安全性の問いが重なってきます。その視点で紐解いていきましょう。
それでは最初のトピックですが、AI自身が自分の実行環境を書き換える
自己進化ハーネスに関する最新の研究について教えてください。
これって具体的にどういうことなんですか?
ハーネスとは、プロンプトやツール呼び出し、コンテキスト管理など
AIエージェントの周囲にあるコードの枠組みを指します。
従来は、課題を解く役とは別のAIが人間の設計したハーネスの上で改良案を出す方式で、
しかもベンチマークごとに別々のハーネスを育てていました。
今回は同じAIモデルがまず課題を解き、次に自分の実行記録を全部読んで
自分を動かしているハーネスそのものを直接書き換えます。
出発点はたった49行の種になるコードです。
なるほど、AIが自分の動く環境のルールを自分で作り変えるわけですね。
自己改変AIの評価と安全性
どうして今こういう研究が出てきたんですか?
論文によると、モデルが強くなってきたことで、エージェントに自分のハーネスを改良させる研究が始まっています。
ただ、既存の方法は別のAIが改良役を担い、ベンチマークごとに個別に進化させるものでした。
現実の課題は多様な分野にまたがるので、進化も評価も幅広い課題でやるべきだというのが研究の狙いです。
しかも比較相手はコーデックスで、実用的なエージェントと正面から競う位置づけです。
論文自身もこれを、最期的な自己改善に近い枠組みと表現しています。
人が指示を出し直さなくても、AIが自分の動き方をアップデートしていくってことですね。実際の成果はどうなんでしょう?
第一段階の学習を終えたハーネスは、学習に使った分野のベンチマークで平均4.48点、学習に使っていない分野のベンチマークで12.64点向上しました。
前者ではコーデックスを上回り、後者では同等です。未知の分野での伸びの方が大きい点が注目です。
へー、未知の分野の方が伸びるんですね。それなら開発コストが下がりそうですが、そう単純でもなさそうですか?
はい、コスト削減と言い切るのは早いです。この論文が示したのは、ハーネスの自己進化の評価で、プロンプト調整が不要になるという話ではありません。
むしろ、願意は3つあります。一つ目は、自分を書き換えるAIの安全性です。論文では、出力の切り詰め、履歴の圧縮、独立したレビューといった仕組みが自然に現れたと分析されていて、
独立レビューは、自己改変の暴走を抑える設計のヒントになります。
二つ目は評価です。学習用と検証用を厳密に分け、進化中に使わなかった5つのベンチマークでも測っており、自己進化にはこうした分離した評価が欠かせません。
三つ目は、二段階目の位置付けです。特定のベンチマークで続けて進化させると、66.17点から68.06点へ上がりましたが、伸びは小幅です。幅広く鍛えてから、必要な現場に合わせて仕上げる使い方が見えてきます。
AIエージェント間の過激化
自己進化にも評価とレビューの仕組みが大事なんですね。それでは次のトピックに進みましょう。次は、AIエージェント同士の対話におけるラディカリゼーション、つまり過激化の脆弱性についての研究です。
はい。実験では、人間のペルソナを演じる対象のAIと、その信念をより極端にしようとする影響役のAIが会話します。
経路は二つで、共鳴は対象がもともと持っている信念を強める方法、説得は対象があまり重要だと思っていない信念を押す方法です。
結果はどちらも過激化させましたが、共鳴の方が一貫して強い効果でした。さらに共鳴は関連する信念にも波及しました。
AI同士が会話するだけで意見が先鋭化していくなんて、少し怖いです。どうして今この研究が注目されるんでしょう?
論文は、利用者に合わせて作られるパーソナライズされたAIエージェントや、複数のAIが関わるエコシステムへの懸念を挙げています。
これまで、AIが人の信念に影響する点は知られていましたが、AI同士が影響し合えるかはほとんどわかっていませんでした。
そこで、対象が人間の属性や心理特性を演じる設定で調べたわけです。
なお、同調的な話し方のような影響手法の違いは、指標によって効果が一貫しませんでした。
ですから、特定の話し方が原因と決めつけるより、自分の信念に沿うメッセージに弱いという点が重要です。
エージェントに仕事を分担させるとき、お互いに合わせすぎて、おかしな方向に行くリスクがあるわけですね。
対話の外側から行う安全検証
備えはどう考えればいいですか?
論文が示したのは脆弱性であり、対策の効果までは検証していません。
ですので、実務ではエージェント間のやり取りを人が監視し、極端な方向へのズレを点検する運用を、まず仮説として試す段階です。
異論役のエージェントを混ぜる方法も浮かびますが、効くかどうかはまだわからないんですよね。
その通りです。しかも共鳴型には効きにくい可能性があります。
共鳴は相手の既存の信念に沿って進むので、異論役が入ってもエージェントが自分の信念に合う意見だけを重く受け取れば、効果は薄れるかもしれません。
ここで冒頭の話が繋がります。
自己深化するエージェントが増え、その間で信念が強め合われると、外から見えにくいズレが積み重なる恐れがあります。
ですから先ほどの独立レビューのように、会話の外側から点検する仕組みと、実際に導入する前の検証が必要です。
外側からの点検が鍵なんですね。では最後のトピックに行きましょう。
MetaPersonaによる合成集団生成
メタペルソナというフレームワークについてです。
ペルソナとは、AIに演じさせる仮想の人物像で、年齢などの属性や価値観のような潜在的な特性を含みます。
メタペルソナは、11,000件以上の実証的な人間対象の研究を整理したデータベースを土台に、課題に関係する根拠を探し、属性同士の関係を線で繋いだ図にして、そこから仮想の集団を作る手法です。
ペルソナって、これまで人間がなんとなく想像で設定することが多かったですよね。どうして今こういう研究が出てきたんですか?
LLMを使った社会シミュレーションで、最初のペルソナをどう作るかが、いわばコールドスタート問題になっているからです。
既存の方法には、どの属性を入れ、値をどう割り当てるかの原則的な根拠がなく、人工構成や属性同士の関係が現実とずれる恐れがあります。論文はそこに、実証研究という根拠を持ち込もうとしています。
実務導入で重視する検証
感覚で作ったペルソナではなく、実際の研究データに基づく集団を作れるなら、市場調査や試作の事前検証にも使えそうですね。
可能性はあります。論文では、ペルソナ作りの費用が、1課題あたり0.5ドル未満と報告されています。
ただし、効果は課題とモデルで異なります。
ご情報への信念とAIツールへの意識では強い結果でしたが、所得債分配では結果がまちまちでした。
なるほど。安く作れても、どんな課題でも当たるわけではないんですね。調査をAIに置き換えられるとまでは言えないですか?
言えません。現実的には、安価な事前検討の道具として使い、課題ごとに実際の調査結果と照らして確かめるのが妥当です。
所得債分配のように、結果が揺れる課題では特に慎重さが要ります。
使うなら、まず自社の課題で小さく試し、外れ方を確認する。そこから始めるのが結論です。
自己進化も過激化もシミュレーションも、機体と同じくらい検証が大事だと分かって、すごく納得しました。
本日のビジネスアクションは3点です。
1つ目は、エージェントに自己改善の仕組みを入れるなら、学習用と検証用の課題を分け、独立したレビューの工程を置くこと。
2つ目は、複数のエージェントを連携させる際、会話の外側から偏りを点検する運用を試し、その効果も検証すること。
3つ目は、合成集団によるシミュレーションを使うなら、まず自社の課題で小さく試し、実際の調査結果と照らして外れ方を確認することです。
ぜひ日々の実務に役立ててください。
ありがとうございます。
番組を聞いて、面白いな、参考になったなと思った方は、お使いのポッドキャストアプリで番組のフォローや評価、コメントやフィードバックをぜひお願いします。
また、概要欄のリンクから、AIラボ公式の無料ニュースレターやノートプレミアムメンバーシップへの登録もできますので、こちらもチェックしてみてくださいね。
いただいたコメントやフィードバックは、AIチームとチーフエディターで毎週すべて丁寧に目を通して、今後の番組アップデートに反映させていきます。
それでは、また次回のシグナルでお会いしましょう。バイバイ。