1. AIと仕事の仕組み化ラジオ
  2. AIエージェント日次速報 2026..
AIエージェント日次速報 2026年8月8日版 エージェントの仕事を「見える証拠」に変える
2026-08-08 05:57

AIエージェント日次速報 2026年8月8日版 エージェントの仕事を「見える証拠」に変える

AIエージェントの仕事を、後から誰でも追える証拠として残すための実践的な整理です。

感想

まだ感想はありません。最初の1件を書きましょう!

00:00
あの、AIに複雑な仕事を丸投げして、数分後に完璧な結果がポンと出てきたとき、まあ、ほっとする代わりに、
えーと、一体どうやってこの結果にたどり着いたの?って、冷や汗をかいた経験、あなたにもありませんか?
ああ、ありますね。最終的なアウトプットがどれほど素晴らしくても、その過程が完全にブラックボックスだと、いや、実際の仕事ではちょっと怖くて使えないじゃないですか。
そうなんですよ。なので、今回の深掘りでは、あるITエンジニアのノート資料から、AIエージェントのタスクを、
単なる読めないログから、人間が安心できる、えーと、見える証拠へと変えるための設計思想を解き明かしていきます。
はい。情報型にならずに、要点を素早く確実につかみたいあなたにぴったりの内容ですね。
早速いきましょう。先ほどのブラックボックスの恐怖なんですけど、例えるなら、レストランで見習いシェフが完璧な見た目のケーキを出してきても、
あの塩と砂糖どちらを使ったか、手順が不明ならちょっとお客様には出せないですよね。
ええ、全くその通りです。だからこそ、AIエージェントには構造化された記録、つまりレシピと味見の記録が求められるわけです。
なるほど。レシピと味見の記録ですね。
はい。例えば、オープンAIのCodexなんかは、ただ動きましたと結果を出すんじゃなくて、ターミナルでの変更点とかテスト結果を人間が見やすいレビュー画面に集約してくれるんですよ。
ああ、それは助かりますね。でも、資料にあるクロードコードのアプローチを見ると、セッションIDとかJSON形式を活用して記録を残すってありますよね。
ええ、そうですね。
ちょっと待ってください。JSONって人間がパッと見て直感的に読めるものじゃないですよね。逆にブラックボックス化しませんか?
ああ、そこがすごく面白いポイントなんですよ。JSONの目的って人間のためというより、次にバトンを受け取るその別の自動化システムのためなんです。
別のシステムのためですか?
はい。人間の記憶や感覚に頼らずに機械が確実に処理を引き継げる、いわゆる監査線を引いているわけです。
なるほど。Codexみたいに人間向けに要約する画面と機械が処理しやすいJSON。この両輪で監視の境界線を作るのが重要なんですね。
そういうことです。
でも、テキストやコードの処理ならそれでいいとして、もしAIがウェブサイトを操作するような視覚的なタスクだったらどうなるんですか?
と言いますと?
コードのログだけ渡されても、画面上で何が起きたか全く想像できませんよ。
ああ、だからこそ、タスクに応じて証拠の形を変える必要があるんですよね。
形を変える。具体的にはどういうことですか?
例えば、Googleアンティグラビティなどのプロジェクトでは、テキストログの代わりにブラウザのスクリーンショットや録画といった成果物を証拠として残すんです。
ああ、なるほど。テキストの慣れ強い画像の方が人間が一瞬でミスを把握できますからね。
ええ、そうなんです。
確かに。でもスクショを見て、ここで間違えてるって気づいたとしても、もう作業は終わっちゃってますよね。
03:00
家が建った後に壁を壊して配管ミスを探すようなもので修正コストが高すぎませんか?
おっしゃる通りです。まさにその問題を解決するのが、マヌスというエージェントが実装している計画モードなんですよ。
計画モードですか?
はい。これは実行の後ではなく前に、これから何をするか、構造化した計画書を提示してくれるんです。
ということは、AIに設計図を先に出させて、人間が犯行を押さないと動けないようにするわけですか?
まさにそのイメージです。
それなら着手前に暴走を防げますね。
では、こうした様々な証拠が出揃ったとして、それを実際の業務フローでどう管理するかが次の課題になりそうですね。
資料にはいくつかのアプローチがありますが、個人的に注目したいのはオープンクローの仕組みですね。
それ私も思いました。セッションの履歴とタスクの台帳を明確に分離している点ですよね。
そうです。
これどういうメカニズムなのか、もう少し詳しく教えてもらえますか?
はい。AIって時々メールの下書きを作っただけの状態なのに、メールを送信しましたって勘違いして人間に報告することがあるんですよ。
ああ、ありますね。そういう謎の思い込み。
ええ。でもオープンCLOのように、作業プロセスと実際の成果を切り離して管理すれば、実行済みだけどまだ未配送といったステータスのズレをシステム的に防げるんです。
なるほど。さらにゲンスパークのように、途中の推論過程ではなくて、ドックスやシーツといった最終的な完成品そのものを確認画面に置くアプローチも組み合わさると、より現場に馴染みますよね。
本当にそうですね。資料の著者は、こうした管理の仕組みを最終的に5つの項目を持つ証拠カードとして提唱しています。
えっと、その5つというのは?
依頼内容、加えた変更、検証結果、未確認事項、そして次の状態ですね。
いやあ、こうして整理していくと、私たちの役割が根本的に変わっていくのがわかりますね。
AIの横に張り付いて全操作を監視するマイクロマネージャーから、この証拠カードを見て次の展開をジャッジする監査役への進化ですね。
ええ、まさに。AIがいかに賢く自律的に動くかだけでなく、動いた結果を人間が確実に検証できる形で返せること、それこそが現場で本当に使えるエージェントの必要条件なんですよ。
いやあ、今日はAIの監査と証拠という非常にリアルな最前線を見てきました。最後にあなたに1つ考えてみてほしいことがあります。
はい、何でしょう?
リスナーの皆さんに向けてですね、もし私たちの主な仕事がAIの作った証拠カードをレビューすることになったとして、将来そのレビュー作業すら別のAIが担うようになったとき、人間にしか残せない直感や最終判断の基準とは一体何になるのでしょうか?
うーん、それは深いテーマですね。
はい、ぜひあなた自身の業務に当てはめて考えてみてください。それでは今回の深掘りはここまでです。
05:57

コメント

スクロール