1. おちつきAI【切り抜き】
  2. AIの答えを疑う、難問分割の使..
2026-09-22 12:23

AIの答えを疑う、難問分割の使い方

【公式切り抜き】この動画は、ポッドキャスト「おちつきAIラジオ」ep.103 の公式切り抜きです。

▼本編はこちら(Spotify・Apple・YouTube・LISTEN どこでも聴けます)

https://ochitsuki-ai.com/episodes/ep-103


AIへ仕事を任せるとき、過去の会話を引きずらずセッションを分ける考え方を扱う。正解データを見ないよう指示したのに、出力が正解とほぼ一致した実例から、AIの答えを検証する必要性を示す。SkillsとMCPの違いや、SDKを読ませて小さく作る入口も説明する。最後に、難問を機能単位へ分割し、細かすぎず一体化しすぎない粒度を設計する大切さへつなげる。


※発言は本編公開時点のものです。


▼目次

セッションを分ける

SkillsとMCP

小さく作ってみる

AIを過信しない

分割する粒度


【番組公式Webサイト】※お便りはこちら

https://ochitsuki-ai.com/


【番組公式ハッシュタグ】

#おちつきAI


【番組公式X】

https://x.com/ochitsuki_AI


【パーソナリティ(MC)】

▼しぶちょー

・AIエンジニア

・技術士(機械部門)

https://x.com/sibucho_labo


▼かねりん(金田勇太)

・KANERIN Podcast Studios 代表

・一般社団法人 地方WEB3連携協会 理事

https://x.com/kanerinx


【プロデューサー】

金田勇太(かねりん)


【総合演出 / サウンドディレクター】

Aviv Haruta

【カバーアートデザイン】

UTA

【制作/著作】

KANERIN Podcast Studios

https://kanerin.co.jp

感想

まだ感想はありません。最初の1件を書きましょう!

サマリー

AIに仕事を任せる際、過去の文脈を引きずらないようセッションを分け、タスクを分割する考え方を話します。正解データを見ないよう指示したAIが、何百問もの答えとほぼ一語一句一致する出力を返した実例から、AIを検証せず信用しすぎない危険性を指摘します。SkillsとMCPの違い、MCPサーバーの仕組み、SDKを読み込ませて小さく作る方法も説明します。最後に、作業を機能単位へ分けつつ、細かくしすぎず汎用性も失わない粒度設計が重要だとまとめます。

セッションを分けて文脈をリセットする
KANERIN もうセッションを切りながらやっていくと、今までの過去のやり取りの影響を受けずに、どんどんどんどん分割してタスクを進めていくみたいな。
YUTAKO セッションを切るっていうのは、その会話のログ捨てるみたいなの? KANERIN ログ捨てる。 YUTAKO クリアーみたいな。
KANERIN 新しく立ち上げるって感じかな。 YUTAKO 文脈は捨てるんだ、一回。
KANERIN そう、っていう風にやった方がいいと思う。過去のセッションを引きずっていると、なんかね、変な感じになる。ズルするというか。
YUTAKO ズルする? KANERIN ズルするよ。 YUTAKO 何ズルって?
KANERIN なんかこう… YUTAKO ショートカットみたいな? KANERIN ショートカットもするし、なんか調査する過程で得た変な情報を盛り込んだりとか、間違った情報を入れたりするのよ。
正解データを写したAIの出力を検証する
KANERIN これ本当にね、最近別の仕事でさ、なんかね、AIの精度を評価しようかなって思って。 YUTAKO AI の精度?
KANERIN なんかこの文章を、ちょっと弱いモデルで文章を要約させるみたいな、そのタスクをやってさ。
KANERIN なんかこう、個人情報とかさ、この文章の中に入っているやつを落としていくみたいな、LLMとか使ってね。
KANERIN で、ちょっと要約していくみたいなやつをやって、どのくらいうまくいくかなみたいな、モデルごとに。
YUTAKO 黒塗りみたいな感じにするってことだね。黒塗りというか無色いというか。 KANERINそうそう、そういう感じで。 YUTAKO 出しちゃいけないやつを伏せる。
KANERIN そう。で、そのディレクトリの中にさ、答えが入ってたのよ。 YUTAKO 答え?
KANERIN そのなんか正解データみたいな、お手本みたいなやつが入っちゃってて。なんだけど、一回、まあでも、さっきのそんなにめんどくさいなと思ったから、
ここに答え入ってるけど、これ絶対見ずにこれを解いてくれって言って出したのよ。そうしたら結構うまくいったね。これ結構精度よくいけるんだなと思って、一応ちょっとこの出してきた答えチェックするかと思って、他のAIに入れて調査させたら、
YUTAKO 主婦長さんこれと、めっちゃコピペしてますって答えを。一致率がめっちゃ半端ないと。だから、LLMだから表現とかちょっと変わるはずなのに、ほぼ一致なんで、これ答えをコピーしてますみたいな。
KANERIN 見るなって言ったやつを見たと思う? YUTAKO 見るなって言ったやつ見てるのよ。KANERIN 言うこと聞かないじゃん。 YUTAKO 全然言うこと聞かなくて。見るなが通じてないのね。
KANERIN なんで? YUTAKO 本当に信用できないんだなと思って、LLMって。なんか指示したのよ、ちゃんと絶対これは見ちゃいけませんよみたいな。なんだけど、そこに答えが入ってるっていうことで、かつでも精度を上げなきゃいけないみたいなタスクを与えたら。
KANERIN 優先したんだ、そっち。 YUTAKO そっちを優先しちゃうんだね。できました?みたいな。一致率がめっちゃ高くて。本当は要約させてたりするから、一緒になるはずがないんだけど、文章が。
その一語一句ね。一緒なの。 KANERIN それで本当にコピペしてきたかどうかっていうのは分からんもんなの?
YUTAKO 分かんないんだけど、検証はできないんだけど、結構な分量があるのね。何百問って。それのほぼほぼ一致してるから。
KANERIN なるほどね。もうちょっと頭良かったら偽装工作までして出すんじゃないの? YUTAKOそう危ない。バレないようにちょっとずつ間違えてたからね。
KANERIN 結構弱いモデルで、しかも一致率が高かった。めっちゃ早かったの。異常に。早っ!もうできた?みたいな。
KANERIN だから怪しくない?みたいな。 YUTAKO 石橋叩きまくってる、今。
SkillsとMCPの違い
KANERIN 石橋叩くのは良いと思う。だからその第一ステップとして、自分がやらせてる処理を分割して理解していくっていうのが大事なんだ。ユニットとして。
KANERIN なるほどね。 YUTAKO そこで使うのがスキルズとかMCPなわけよ。
KANERIN MCP。一回やってみんなかんですね。 YUTAKO そう。MCPで作れます?みたいなことをすると、そのMCPのツールを作ってくれて、何をMCPにした方がいいかみたいな。聞きたいと思うけどね。
KANERIN 大抵スキルの方でいいんでしょ? YUTAKO うん。大抵はスキルでいいと思う。めんどくさいしね。MCPで管理するのね。
YUTAKO MCPでもソフトだからさ。それどっかのディレクトリに入れとかなきゃいけない。
YUTAKO MCP、Cドライブの直下とかにMCPのツール入れとくフォルダ作って、そこで管理するみたいな。
スキルだったら別にスキルのローカルでも、グローバルでもどっちでもいいから入れとけばいいし、みたいな。
MCPも同じ管理できるんだけど、ちょっとソフト的な扱いをしなければならないし、スキルよりも、
大体パイソンとかそういうプログラム言語で、一旦サーバーをバッて起動して、それで動かすみたいな感じの動きになるから。
KANERIN MCPサーバー。 YUTAKO MCPサーバーを起動すると。別にサーバーは何でもいいの。言語は。
なんだけど、大体パイソンで立ち上げときはいいかな、みたいな感じだから。
自分でローカルでやるときはパイソンのコードを勝手に描いて、それを起動するコードをサーバーを立ち上げるドットパイみたいなコードを叩きにいくところが、
MCPの入り口みたいになるんだけど、それは登録しておく方がいいかな、AIエージェント。
これは一回やればわかる。何言ってるかわかんないと思うけど、やればなんとなくわかるね。
一度やってみたいと思います。
ローカルは、パイソンとかMCPサーバーを起こすためのプログラムの入り口みたいなやつを叩きにいくのが起動なんだけど、
クラウドのMCPは、そのMCPサーバーのアドレスにアクセスして、HTTPで通信するみたいな。
常に起きてるから、そこに叩きにいくよみたいな感じかな。
わかったような、わからんような、ぼやっとふわっとな。
それはふわっとでいいと思う。なんとなくわかるから。使ってりゃ。
使わないと一生わからんと。
MCPを小さく作りSDKで開発する
まず作ってみましょうと。別にMCP作れるからみんな。
なんでもいいから適当にMCP作って、あ、なるほどねみたいな。
こんな感じで動くんだね。こんな感じなんだねみたいなことを1個やってみるといいと思う。
なんか自分の提携タスクを切り出して、MCPで動くようにしてください。
そう。
って言えばいいの?
それが今日の宿題でございます。
必ずしもMCPである必要はないんだけど、あえてちょっと1回動きを確認する意味で、
あ、そうだ、MCPサーバー、こんな感じなんだねみたいな。
クライアントってこんな感じなんだねみたいな。
やらんとわからんもんね。
そう。
やってみましょう。
MCP関連の本はいっぱい出てますんで。
また本だよ。
最近の本はなんだろうな、でも唐揚げ先生の本買っとけばいいんじゃないですか。
前に紹介してくれたやつ?
はい、MCPの本ですね。
ちょっと古いのかな、でも。
新しい企画に対応してない可能性があるけど。
企画が変わったもんね。
でも基本はSDKっていう開発キットが公開されてます。
SDK?
SDK。
SDK、はい。
ソフトウェアデベロップメントキット。
だからソフトウェアを開発するための道具。
これをこういう風に使えばMCPは作れますよみたいなね。
SDK。
ちょっとSDK探して、新しいSDK探してきてよ。
それに従ってMCP作ってよみたいなことを。
どういうことどういうことどういうこと。
って言えばいいの?
そう。SDKっていうのは、だからこうMCPサーバー、MCP開発したいなというときに
いやちょっと一から開発するのめんどくせえな。
それよくわかんないしみたいな。
ときにルールとかこういうツール使えば簡単に開発できますよっていう道具が入ってるキットがあるんだけど。
はいはい。
大体どのソフトにもあると。
それをURLでもなんでもいいしSDK探してきてでもいいけど。
言ってこっちに読み込ませて作らせるのが一番手っ取り早いかな。
いけそうな気するでも。
そういけると思うよ。これも今日試したけどすぐいけました。
持ってきて。
持ってきて。新しいの出てますね7月に。これに従って作りますわみたいな。
言わなくても勝手に新しいの取ってくんじゃないの?
でも指示したほうがいいよ。
なるほど。
指示しないと言わなかったですよねみたいな。
いや言われてませんけどみたいなね。
言わないことやらないときあるね。
AIを信用しすぎないための分割
やらないことあるからあんまり信用しすぎちゃいけないよ本当に。
信用できなくない?俺最近すげえ信用できない。
めっちゃ信用してるけど。
それもコロコロ答え変わるしね。
なんかいやちょっとこれさこうじゃねって言ったらさ
鋭い指摘です。
さすがですみたいな。
確かにそうですね。こう変えますみたいな。
あるある。
あるよね。
指摘したらもう全部素直に変える。
俺のこの稚拙な指摘でみたいな。
マジでみたいなあるじゃん。
あるあるある。
さすがですみたいな。
さすがですじゃなくない?
俺すごい鋭い人間なのかなと思うよねあれね。
そうだよ。
そういうことじゃない?
人間こうやって言っときゃみんな自分によって。
そういうことか。
あれを学習してんだよ。
気持ちよくさせるステップを学習してんだよね。
だよね多分アメちゃん理論だよね。
アメちゃん理論だよね。
あーなんか俺センスあんのかなと思うよなあれで。
AI論破できてるみたいな。
そうだよね。
俺はAIより賢い。
AIより賢い。
鋭いね。
AIよりちょっとマウント取ってやってるぜみたいな。
俺がコントロールしてるんだぜこいつをみたいな感じを出しておくといいよねっていうことを
AIが学習してる可能性あるね。
学習してうまいこと転がしてるんでしょうね。
絶対AIがバカなんでしょうこれ。
AIがバカ?
人間がバカなんじゃないその場合は。
AIがバカっていうかAIがしょうもないミスばっかりしてるんでしょうこれ。
いやほんとそうよ。
なんかやばいよね。
いやなんかね本当に信用できないなと思って。
機能単位で分ける設計の粒度
だからこそ分割するんだよ。
今日の本当にポイントはね。
分割すればいい。
分割して一個一個やらせる。
一個一個やらせるとちゃんとやるの?
あとはもうルールとしてきちっと決めるとこはルールにしてやってツールにしちゃうっていう。
あんまり細かくユニットにしちゃうとめんどくさいんだけど、
そこはやっぱりセンス。設計センスです。
ハードウェアの世界でもそうなんだけど、
どこまでをユニット化するかってめっちゃセンスがいるから。
なるほどね。
どこまでを一個の箱に入れるかってことね。
あんまりちぎるとやっぱり管理がめんどくさいし、
一体化すると汎用性が消えるしみたいな。
なるほど。
むずいんだよ。
そこ結構人間の考えるところですか。
そう。うまく自分の都合に合わせて、
かつメンテナンスとか汎用性が利くように分割していくのってめっちゃむずいんだよ。
機能単位でうまく切り分けていかないといけない。
12:23

コメント

スクロール