1. AI駆動開発部の日常
  2. 60【Claude Fable 5.1の実力】..
60【Claude Fable 5.1の実力】ファーストインプレッション
2026-09-03 21:56

60【Claude Fable 5.1の実力】ファーストインプレッション

今回は、昨日突然出てきたAnthropicのClaude Fable 5.1を起点に、ファーストインプレッションを本音で話しました。

ベンチマークは軒並み上がっているのに、僕の使用感はまだClaude Fable 5から大きく動いていない。阿部さんも感覚としては変わらないと言いつつ、リミットの減りが穏やかになった気もする、と数字との間で印象が割れる。

セーフガードの誤判定が減った話や、effortをLowにしてもClaude Fable 5のMaxを超えるという数字はある。それでもキャッシュヒットを1時間に伸ばすと単価が上がるのか、トークン効率は本当に良くなったのか、答えより問いが増えた回かもしれません。

後半は、デザイン力が上がったという声がClaude Code側のハーネスの話なのか、モデル単体の話なのかも掘り下げています。

【関連リンク】
▼Claude Fable 5.1
https://www.anthropic.com/claude-fable-and-mythos-5-1

【配信サービス】
▼Spotify
https://open.spotify.com/show/5b4x1u0M2f0Kmr1Xnv1Z7r?si=12580ee9ade0414e
▼Youtube
https://youtube.com/@ai-nichijo-fm
▼Apple Podcasts
https://podcasts.apple.com/jp/podcast/ai%E9%A7%86%E5%8B%95%E9%96%8B%E7%99%BA%E9%83%A8%E3%81%AE%E6%97%A5%E5%B8%B8/id1843990202
▼amazon music
https://music.amazon.co.jp/podcasts/4fd4926b-a654-4dc7-a858-01ff5e0e8c25/ai%E9%A7%86%E5%8B%95%E9%96%8B%E7%99%BA%E9%83%A8%E3%81%AE%E6%97%A5%E5%B8%B8
▼stand.fm
https://stand.fm/channels/68dc82a9036795923c400b4f
▼LISTEN
https://listen.style/p/ai-nichijo-fm?xtIZk9qq
---
stand.fmでは、この放送にいいね・コメント・レター送信ができます。
https://stand.fm/channels/68dc82a9036795923c400b4f

感想

まだ感想はありません。最初の1件を書きましょう!

サマリー

今回のエピソードでは、AnthropicのClaude Fable 5.1のファーストインプレッションについて語られています。ベンチマークスコアは大幅に向上しているものの、実際の使用感はClaude Fable 5から劇的な変化を感じないという意見がある一方、リミット消費の穏やかさやセーフガードの誤判定減少といった改善点も指摘されています。トークン効率やコストに関する疑問も呈され、後半ではデザイン力の向上についても掘り下げられています。

Claude Fable 5.1の登場と第一印象
こんにちは、AI駆動開発部の日常へようこそ。このポッドキャストは、日々AI駆動開発を行う企業課の山本とエンジニアの阿部が、AI駆動開発のリアルを緩く語り合う番組です。
はい、じゃあよろしくお願いします。
はい、よろしくお願いします。
はい、じゃあちょっと今日は、とうとう来ました。
Fable 5.1。
はい。
とうとうと言ってもね。
出るって噂、僕知らなかったんですけど。
僕も知りませんでした。
出たって思って、昨日。
そう、出た。なんか、そう、なんかいつもね。
あとなんか、個人的な感覚で言うと、なんかね、めっちゃ嬉しいみたいな感覚もなくですね。
ほんとですか。
なんかちょっとFable 5.1で割と満足してるみたいなところもあるのかな、もしかしたら。ちょっとわかんないけど。
それは少しあるね。僕は出た瞬間は別の意味で歓喜してましたけどね。
Fableのリミッターがもう終わりになりそうで。
はいはいはいはい。
買えなくなるなーと思って、夜中の3時ぐらいに採用してたら、なんかゼロになって壊れたかなと思ったら。
リリース記念として、リミットのリセットされてたんで、また買えるじゃん。
そういう意味では嬉しかったけどね。
確かに。
とはいえ、確かに5.1で出たんだっていう感覚は、そうかもしれないですね。
なんかそう、それが出たこと自体に対してのこう、
いやまあね、嬉しいんですけどね。ありがとうございますって感じなんやけど、
うんうんって感じの、はい、ですね。
まあちょっと、まだ出たばかりなので、そんなにめっちゃね、使ってるわけではないんですけれども、
まあいくつか特徴とかがあるんで、その辺りの話をできたらいいかなというふうに思っております。
はい。
Claude Fable 5.1の進化点とベンチマーク
はい。一応、フェーブル5.1がどういった進化を遂げてるのか、5からですね、っていうところを話していきたいかなというふうに思っていますが、
基本的には長時間の、一番特筆すべきポイントとしては長時間のタスクの精度が上がりましたよっていうところが言われてるのかなというふうに思っています。
あとなんかキャッシュフィットとかね、いろいろ言われてますね。
あと、エフォート切り替えるとさ、キャッシュとか引き継げなかったみたいなのが引き継げるようになったと。
なんですけど、今僕の手元でやってると、引き継げないよみたいなアラートが出るんで、これからアップデートされるみたいなところもあるのかなっていうふうに。
もしかしたらクロードコード側のあれかもしれない。
そうそうそう、なのかなっていうふうに思ってますっていう感じです。
基本的にはベンチマークはのきなみ上がっているというところなんで、かなりの進化なのかなっていうふうに思ってます。
もともとすごかったのにね。
またすごい伸びてるなって僕は見てて。
エジェンティックリサーチとかはね、もともと24.7%だったのが52.6%。倍になってんじゃん。
これはあれらしいね、サイエンティフィックリサーチなんで、より実験とか。
そういうのを仮説立てをしてみたいなとか。
その辺のプロセスの改善みたいなのがすごい良くなってる。
がゆえに、ここのベンチがガンと上がったみたいな感じのようですね。
実際に使ってみて、じゃあなんか変わったなみたいな感じがあるかどうかと言われると、
僕の今の感覚で言うと、そんなにまだフェーブルと知的探究的な意味合いでの問答みたいなのをする作業をそこまでこなしてないんで、
なので今のところはまだ5からじゃあめっちゃ変わったかと言われると、そんなにって感じですね。
使用感としてはまだそんなにイメージとしては上がったなみたいなことを感じてないんで、
ここめっちゃ良くなったじゃんみたいなのが見出せてきたら、ちょっとまたBadcastでシェアとかできればいいかなと思ってるんですけれども、
僕の感じで言うとそうですね、そんなにかなーって感じ。
アベちゃんは?
僕はね、なんかまず使ってる感覚で言うとそんなに変わらないんだけど、変わっているなっていう感覚がないって言った方がいいのかな?なんだけど、
なんかフェーブルのリミットの消費が穏やかになった気がして、
なんか体感をこんなに使ったら、まあ今こんぐらいいつもなら消費してるだろうなと思いながらいつも結構頻繁に消費を見に行くんですけど、
昨日の3時に公開されてから、ちょっと明け方まで作業してて、そんなに減らなかったんですよ、思ってるよりも。
体感、普段より10%くらいか20%くらい減りが遅いなと思っていたので、
何かこの、さっきもヤマちゃん言ってたと思うんですけど、キャッシュが安くなったとかなのか、
頭が良くなった結果、トークン効率が上がったのかみたいなのはあるのかな?どうなんだろう?みたいな、そういうぐらいの感触ですね。
そうだね、まあちょっと俺の場合は今、自分が使ってるツールがちょっとはちゃめちゃな感じになってて、
ツールが動かないっていう課題の方がちょっと影響力が大きすぎてですね、
なんか、ちょっとね、まともな精神状態じゃない。
まともな精神状態じゃないっていう問題にぶち当たってて、なんともですね、はい。
っていう感じです。あとあれかな?安全弁が変わったっていうのも一個。
セフティガードが優秀になって誤判定が減ったとか。
それはありがたいよね、地味に。結構ね、引っかかるときあったからね。
そうだね、これはありがたい。困るんですよね。特に長時間のタスクさせてるときに、
まあ割と長時間タスク任せるときって放置しがちなんですけど、特にフェーブルって割と優秀なんでお任せできるかなって。
戻ってきたらオーパスになってたみたいな。フィニック版になるっていうのがあったんで。
あと面白いのが、フェーブルのエフォートを仮にローにしたとて、
フェーブルの5.1をローにしたとて、フェーブル5のMAXよりベンチがいい。
すごいね。
っていうのがあるみたいなので、そういう意味では一番下でもいいのか。
もちろんベンチによっては上回ってるとかあると思うけど、
使用感とリミット消費の変化
同等とかそんな感じでできるのかと思うと、ローに安心感を持ちながら。
これはなんか人側の心理的な問題やけど。
意外と心理的な問題も大事だから。
心理的にローに躊躇なくできるっていう安心感も意外と結構いいのかなって思って。
確かに。ローにしてちょっと動かして。
僕ちょっと不安になるんで、エクストラ5とかMAX相談しがちというか。
フェーブル使うならそれでやんないとあんま意味ないかっていう気持ちに。
これは前までも結構ハイぐらいでやってたよね。
どうしようもなく話が通じないなみたいな時だけMAXにするみたいな。
割と充分すぎるのかなみたいなふうに思ってます。
あと長時間タスクができるようになったのが結構地味に良くて。
オーケストレーターとしてクロードのフェーブルを使うことが多いから。
長時間のタスクで劣化しないっていう。キャッシュヒットも含めてやんね。
長時間で劣化しないっていう。
あと1時間でキャッシュヒットの枠が。
そうだね。
ただね、デフォルトがキャッシュヒット5分なんだけど。
1時間に変えるとちょっと値段上がるんですよ。
書き込みだと2倍とかになってしまう。キャッシュの書き込みが。
読み取りが2.5%増っていう形になって。
でも1時間持ってくれるならいいんじゃないかなみたいな気持ち若干ありますけどね。
だから長い作業とかそういうのをオーケストレーターだけに使ってるみたいな人とか結構いいんじゃないかなって思ってます。
ちなみに僕はフェーブル使ってて減り早くなったなって感覚ですね今。
僕の今受けてる印象としては。
ただね、ツールのあれで頭おかしくなってるんで僕今。
まともな正常な判断を下せてないっていうんですけど。
アーティフィカルアナリシスのベンチマークを眺めてて。
コストパインテリセンスインデックスタスクってベンチマーク。
要するにある特定のタスクを終了するのにどれくらいのコストかかりましたかっていうベンチマーカーなんですけど。
それがフェーブル5.1めちゃくちゃコスト上がってて。
やっぱ結局高くなるんじゃね?みたいな。消費早くなるんじゃね?みたいな気持ちもありつつなんですよね。
なるほどね。
僕もどうなるんだろうと思いながら。
個人的な所感はキャッシーフィット結構効率的になるんだったなとかって思って。
使ってみたら割と減るなーみたいな感じなので。
ちょっとなんともなんともやね。正直。
なんともだね。
キャッシーフィット試しに1時間に変えてみてタスク走らせたらどうなるか検証してみてもいいかもしれない。
5分って結構オーケストレーションやってると待機時間でもう経っちゃったって。
キャッシー無効になっちゃったってあると思う。
確かにね。
ベンチマークの詳細とモデルの能力
もうけどすごいよね。
GPQAダイヤモンドがもう93%とかね。
GDPVALもAAか。
GDPVAL AAもね。
67までいってるんで。
僕は結構このGDPVAL AA重要なんじゃないかなって思ってる派なんですけど。
個人的にはね。
あとこのオムニサイエンスアキュレーシー。
アキュラシー。
これも結構なんかね。
あれだよね多分。
ファルシネーションが多いか少ないかみたいな。
いやファルシネーションはねオムニサイエンスノンファルシネーションレートっていうのが別でちょっとあって。
あそうなんだ。別なんだこれ。
ん?なんて言ったんだ?オムニサイエンス?
オムニサイエンスアキュレシー。
正当率。知識量と事実への正当率。
知識量的な話なのかな。
だからこれはなんかこうどっちかというと。
ファルシネーションするかどうかというよりは。
なんかそもそも知識の母数というか。
知識が多いかどうかみたいな。
ファルシネーションもねすごい低くなっているから。
9ポイントぐらい低くなっている。
なかなかいい。頼もしいなと。
ここまで来たらマジで頼もしいよね。
バカ高いけど。
いやまあね。
かなり重宝してますよ本当に。
うんうんうん。
デザイン力とツールの役割
本当にタスクをほぼ任せて、
感想してもらって、要求だけをお伝えして、
計画立ててもらって問題なさそうだったら
あとよろしくんで。
いける感じがすごいしてますからね。
うんうんうん。
コーディングの精度というか、
コーディング力も上がったっていうのはね。
けどなんか、
どっちかというと頭の良さに言及している人は
めっちゃ多いわけじゃなくて、
キャッシュヒットとか、
そういうツール側に評価が寄っているなっていうのを
ちょっと感じるよね。
キャッシュヒットもそうだし、
そもそものセーフガード改善したとか、
そういうのに言及している人が多い印象があるよね。
名言しているというか、
もうわかりやすく歌っているところではあるから。
けどなんか、
今までの新しいモデルが出たときと
人は違うじゃん。
こんだけ頭良くなったよみたいな。
確かに3Dモデルをレンダリングして
比較しましたみたいなね。
そんなんじゃなくて、
そういう話じゃなくなってきてるんだなみたいな。
より効率的にみたいな。
っていうのが印象的だなと思ってます。
正直ロングランをやってくれるみたいなのも
もともと別にそこに課題を感じてたわけじゃないから、
このロングランがどの精度だよなんて。
ロングランしてるときってほぼ見ないから。
なんかあれなのかな、コンパクションとかしないで
いろんな議論しても平気だよっていうのが、
それってロングランでもない。
単純にコンテキスト逼迫に対して
態勢があるって話だからちょっと違いそうだね。
5時間ってなんだろう。
どっちかというとキャッシュ読みとかで
コンテキストウィンドウの
逼迫するそもそも速度が遅くなるとか。
俺GLM5.3フラッシュ使ってて、
コンテキストウィンドウが他のモデルより
上がりにくいなって思ってて、
逼迫率が低いなって思ってて。
その上がり幅っていうか同じ量のタスクさせても
それはキャッシュフィットが結構あるんじゃないかな。
だからそういう効率性によって
コンテキストウィンドウ逼迫が減るみたいな。
余分な知識を無駄に蓄えない。
重複して蓄えなくなりやすくなった。
その辺なのかな、もしかしたら。
多分なんか、あれがさ、
フィルター?なんだったっけ。
セーフガードか。
セーフガードの判定精度が上がったってことは
多分そのセーフガードも
どういう類のものなのかみたいな。
判定するのに使ってたと思うよね。
で、どういうものなのか判定するみたいな
精度が上がったってことだと思ってて。
その辺がそういうキャッシュに当たる可能性が
上がったみたいなとか。
他のところにも結構技術としては
類似して転用して
とかあんのかな。
なんだろうな、セーフガードのポイント
強化されたっていうのは
どっちが先なのか分かんないけど
エージェンティックサイエンティフィック
リサーチが倍ぐらいに上がったじゃないですか。
科学分野における推論力が上がったことによって
そういうバイオテロ的な
セーフガードとかに
掛かりにくくなったよっていう話なのかな
って勝手に解釈してたんですけど。
あるのかな。
そっち側の推論力が上がった。
その辺もとはいえ
これってこれに類似する
仮説立てとひも付けの能力という意味では
その辺の話って割と似通ってるような気がするから
いずれにせよね
こんだけベンチマークバーンって上がったら
ちょっとすごいよね。
また1週間くらい使って
どんな感触を得るのか
なんとなく楽しみにはしてますけどね。
そうやね。
デザイン力が上がったとかっていう
ツイートとか見たけどね。
そうなんだ。
うん。
それもまた
クロードもともと結構高い気はしてるけど
まだまだ上がるんですね。
クロードコード
モデル単体のデザイン力はそんなじゃない。
正直まだ。
あれは単純にクロードデザインというツールが
強力っていう話だよね。
ハラミスが強力っていう話で
だからモデルの巣のデザイン力とは
デザインの方が違うと思うから
そういう意味ではまだまだ上がり幅ありそうだな
という意味では期待。
やっぱなんか
初めに出てくるやつで
デザイン微妙で結局クロードデザインに
一回デザインブラッシュアップさせて
それを模倣させるみたいなことを
わざわざしないといけなかった
みたいなのを
初手でどれくらい精度高くやってくれるかって
結構大事かなって思うので
その辺は結構
まとめと今後の展望
期待大って感じかな。
はい、じゃあそんな感じで
今日はちょっと
まだそんな使えてない状況なので
これからで終わりますが
まずはファーストインプレッションというか
ということで
以上にさせていただければと思います。
じゃあありがとうございました。
ありがとうございました。
本日もAI駆動開発部の日常をお聞きいただき
ありがとうございました。
いかがでしたでしょうか。
今回の話題は
フェイブルの5.1ですね。
そんなに噂とか見てなかったので
急に出てきたなって感じなんですけれども
かなりベンチマークとか増えて上がってるので
使ってみて
これからちょっと実際に本格的に使っていって
どうかみたいな話はまたできたらなとは思ってるんですけれども
ファーストインプレッションということで話してみました。
こんな感じで普段からいろいろモデルとか使って
喋っているので
もしこのポッドキャスト気に入ってくれた方は
いいね、フォロー、高評価ぜひお願いいたします。
それではまた次回もお楽しみください。
バイバイ。
21:56

コメント

スクロール