そうです。
で、あともう一つはみんなが期待しているのはヒューマノイド型ロボットだと思うんですよね。
ドラえもんですか?
ドラえもんはヒューマノイドじゃないですよね。
あ、そっか。あれはロボットですね。
あれはロボットなんですけど、あれは猫型ヒューマノイドじゃないですよね。
そうですね。ロボットですね。
ヒューマノイド型ロボットってあるじゃないですか。
で、中国のやつとかでよくデモンストレーションをしていて、サッカーしたりマラソンを走ったりして、マラソンは人間の記録を抜かしたよとかってのがあるんですけれど、
あれがやはり非常に期待されているものだと思います。
ただあれはなかなか技術的にはまだまだ発展途上もいいところかなと思います。
及川さん流定義によると、自動運転とヒューマノイドロボット以外は今のところフィジカルAIにあらずぐらいだからですか?
いや、そんなことないですよ。
産業ロボットとかも全然当てはまると思うんですよね。
だから生産現場とかであるものであったりだとか、あとは様々な工作機械みたいなものだったりっていうのもあると思います。
でもそれって昔からあるので、さっき言った境界線はどこなのかっていうところはあって、
従来から何かの形で視覚情報を元にカメラなりセンサーなりをつけて把握して、それで判断して行動に起こしているっていうものはあるんで、
そう昔のから含めてフィジカルAIって言っていいんだったら言えるし、
ただ、もう一つフィジカルAIって言い出した時に大きな違いっていうのは汎用性だと思うんですよ。
汎用性?
つまり決まりきったことだけやるんだったら昔から産業機械なんて、工場の中入ってロボットってロボットアームでやってくれてるわけじゃないですか。
そこまさに聞きたかったんです。アルゴリズムとの違いなのかなみたいなことを聞きながら思ってたんですけど、
汎用性っていうのはもう少し言うとどういう意味ですか?
例えば工場のラインにこう流れてきて、流れてくるものは全部決まっていて、
ハードウェアだったならばここに箱があります、ここにネジがあります、
ネジを取ってネジをそこに入れてくださいっていうのは決まった手順なわけですよね。
そうじゃなくてヒューマノイド型ロボットみたいなものっていうのは、
ありとあらゆる現場に行ってそこで必要となることを指示されたならばそれを行います。
人間と同じ行動をするって話じゃないですか。
これがやっぱり汎用性の高い部分だと思うんですよ。
例えば自動運転っていう車にしたって、
だいぶ前から決められた敷地内を、この決められたコースをずっと巡回するっていうのは別にできてるわけじゃないですか。
そうじゃなくてある程度の汎用性を持って、当然エリアっていうところはあるけれども、
例えば東京都内だったならばとかっていうのは、これはもう汎用性が高くなっている状態ですよね。
東京台場のこことかある会社の工場の敷地内とか、
工場の中でも普通にAGVって移動するものって走ったりしてるわけじゃないですか。
そうじゃなく人もいるし、自転車もいるし、さまざまな経路もあって、
その経路を判断して曲がっていきた途端に、もう汎用性はめちゃくちゃ上がりますよね。
その汎用度がやっぱりある程度上になったものをフィジカルAIで解くっていうふうに考えた方がいいと。
だからアルゴリズムって基本的には決められた手順があって、
その通り再現してるだけだったと思うんですよね。
で、第二世代のAIっていうのもご存知の通りルールベースって言われてるやつなんで、
もしこうだったらこうっていうことだけやれるものなんです。
実は自動運転もこれで動くんですよ、十分。
ただそのためにはもうそのルールがたくさん必要であったりだとかっていうのであって、
やっぱりその限られたところでしか動けない。
だから今もそのADASって言われている、アドバンスドドライビングアシスタントシステムっていうやつ、
先端運転支援システムってやつは多くの車にも乗ってると思うんですけれども、
高速道路上だったらほぼほぼ手離しても勝手にカーブ曲がってくれたりするじゃないですか。
手を添えてなきゃいけないことが多いんですけど、
あれは高速道路だからだったり、
あとはある速度以下だったらっていうのがついてるはずだと思うんですよね。
そうじゃなくっていうのがやっぱり汎用性が高くなった形だと思います。
あの汎用性って言葉って境界線というか難しいなと思ってて、
この議論すること自体に意味があるかわからないんですけども、
じゃあ例えば産業用ロボットって昔からあって、
じゃあ10ミリの穴を開ける機械なのか、
10ミリも30ミリも50ミリも開けられるって言うのも、
これは汎用化したとも言えるじゃないですか。
ただどんな穴でも開けられますかって言うとそうではないっていうのもあったりしていて、
どっからが汎用化されたものって捉えればいいんですか。
わかんないです。
まあ今言ったところはどんどん汎用性が高くなっているっていうのはその通りだと思います。
ただやっぱり自動運転とかヒューマノイドロボットみたいなところを、
それを頭にイメージするならば、
なんか穴しか開けられないのかお前はっていうのは、
フィジカルAIっていうのはちょっと厳しいと思うんですよね。
穴も開けるし、切るしプレスもするしみたいなのが、
まあなんかそういうマシニングセンターみたいなのありそうですけども、
そうじゃなくて一つの形をしたものがそこまで複雑性の高いものをやったりできるんだったら、
それはフィジカルAIと呼べるんじゃなかろうかと。
そうですね。
まあだから中の技術で言った方が早いかもしれないんですけども、
やっぱりその生成AIの流れを組んだ技術を使うことによって、
汎用性が高いことが可能になるんですよ。
え、どういうことですか。
なんかフィジカルAIと生成AIが関連しているイメージがなかったんですけども。
まずその一つはさっき言ったルールベースじゃないですよっていうところがあるわけですね。
あらかじめルールを組んでいなかったとしても、
自ら何が正しいかっていうことを判断しますというところがあります。
で、もともとそのLLMっていうのがあると思うんですね。
Large Language Modelって言われるのがあって、
やっぱりこれを視覚情報で取るためには、
ランゲージじゃなくてビジュアルになるんですよね、そもそも。
で、考え方は一緒なんですよ。
その視覚情報みたいなものを大量に学習し、
で、それを、まあもともとはVLMっていう風に言ってたんで、
Visual Language Modelっていう形で視覚情報を全部言語化して、
で、それを次の認識だとか行動の方に渡していくってやり方を取るんですけれども、
なので考え方、そのテクノロジーの方向性みたいなところっていうのは似たものがあるんですね。
で、このそもそも生成合いみたいに次に何が来るかみたいな予測みたいな考え方って一緒なわけですよ。
大量のデータから、その過去のデータから次に何が起きるか、何が続くかの予測をするっていうところが出てくるっていうのは考え方としては一緒なんですね。
ちょっと補足をすると、生成合いっていうのは何か推論とかを出しているように見えるけども、
基本的には次の文字ってどの確率が一番高いかなっていうのを高速演算して、
あたかも聞いたことを推論で出してくれているように見えるけども、
やってるのは次の文字を計算してるだけっていうことですよね。
そうですそうです。
で、それがVisualの男でもっていうこと。
そうですそうです。
で、Visual Language ModelっていうのがVisual LanguageActionっていう形になって、
さっき言った、もう一つこれを絶対条件にするかどうかは別にして、
先ほどの認識、判断、行動っていうところを、
昔のロボットとか自動運転って全部別々のモデルが動いてたり、モジュールが動いてるんですよ。
ああ、なんか人認識モジュールとブレーキを使わさせるモジュールとかそういうイメージ?
そういうことですそういうことです。
で、それを全部一体で見るようにしますっていうところが一つのブレークスルーになってるんですね。
車でエンドツーエンドっていう言葉が出てるんですけれど、
それはもう見て、認識して、判断して、
で、何かハンドルを切るとかっていうところまでの処理を指令を出すっていうところまでが、
全部一つのモデルでやるような形になってきていると。
で、こうすることによってやっぱり汎用性が高まったり、処理能力が高まったりっていうところがありますと。
っていうのがあるんですね。
この流れがあって、ただもう一つ重要なのが、物理世界の法則って単に視覚情報だけじゃわかんないものがあって、
ここに物理法則を持ってこなきゃいけないんですね。
それが世界モデルって言われてるやつなんですよ。
で、例えば車の運転で行くならば、
車って昔から別にVLMとかを使わない時から、
昔の機械学習とか深層学習のところの流れで物体認識っていうのができるんですよ。
オブジェクトディテクションっていうのはできるんですね。
で、例えばこれは自転車らしいっていうのは、そこで識別できるんですよ。
で、その自転車らしいものが移動しているっていうふうに見たときに、
例えばの話で言うと、物理的にこの速さで自転車が移動できるわけではないっていう判断を、
やっぱり誰か普通の人間はするわけじゃないですか。
とんでもないと言ったとき、ここには簡単に言うと物理法則が入ったらダメだと思うんですよね。
そのある意味コンテクストというか、物理法則があって初めてその物体が自転車なのかそうじゃないかっていうところを区別できるってことですね。
区別の識別が上がったりするっていうところがあるんで、
なのでそういった物理法則的なものを学習しているモデルっていうのはワールドモデル、世界モデルって言われてるやつになっていて、
これが今組み合わさった形で多くの自動運転だとか、あとはやっぱりフィジカルAIっていうところが使われるようになってきていると。
なのでちょっと今の説明でどこまでわかったかわからない、僕はうまく説明できたかどうかわからないんですけれど、
やっぱり話聞いてるだけで従来のアルゴリズムとは全然違うっていうのがわかると思うんですね。
やっぱり過去のデータを元にして確からしさをしっかりと出し、それに今言った物理法則みたいなものを掛け合わせることによって予測精度を高くし、
もしくは何かのマニプレーションというか操作をしたときのその反応によってそれが何かっていうものを即座に判断したりすることができるようになると思うんですよね。
ここまで行って期待するのがフィジカルAIのこれだけじゃないものをフィジカルAIって呼んで構わないと思うんですけど、わかりやすい例だというふうに思います。
すごくわかったようでわかりきってないような感覚に包まれていまして、
汎用度が高いものなんだろうなっていうのをなんとなくわかったものの、
それって自動運転とヒューマノイドロボット以外って何があるんだろう。
要は結局人間らしいことをできるかどうかなのかなっていう気もしたんですけど、
他なんか生まれてくるんですかね。
必ずしもロボットってヒューマノイド型である必要はないんですよね。
別に二本足じゃなくて足が車輪であったって構わないわけですし、
さっき言った汎用性をどこまで高くするかって話なんだと思うんですよね。
今ヒューマノイドロボットって機体値専攻っていうか、そういったものを作っている方々は過大な広告宣伝が上手い方々が多いんで、
何でもできそうで家庭にも導入されるし、何なら定員にもなってくれるしみたいな感じで見えるんだけれど、
これかなり難しいと思うんですよね。
そう考えたならばやっぱりある程度汎用性とは言っても用途を限定した方がいいのが現実的だというふうに思います。
そう考えるとやっぱりヒューマノイドっていうのは二本足、二本の手で顔があってとかって言うけど、
あれである必然性ってのはやっぱりそんなには高くなくて、
だから本当に汎用性のところがどこまで求めるかによっては、
例えば敷地内動くんだったらそんなに二本足よりも車でいいんじゃない?って言ったら車にすりゃいい話だしっていうところがあるかと思うんで、
なのでやっぱり何かの形で自律的に動いていき、これもちょっと曖昧な言い方しちゃうけれども、
どっかのレベルで単体じゃなくて汎用的な処理ができることっていうのが条件になっていくんじゃないかなと思います。
この汎用と決められたっていうところの境目が非常に難しくて感覚的なものになりそうですよね。
時代時代によってもその判定変わりそうですよね。
そう思います。だからフィジカルAIってバズワードだと思うんですよね。
学術用語でそんなにあるわけじゃないと思いますし、
NVIDIAとかが言ってるのも結構言ってるタイミングによって内容が変わってくるところがあるなというふうに思っていて、
だからやっぱりバズワードなところはあると思います。
そう捉えるとフィジカルAIとして総称で括ることがナンセンスというかあんまり良くない気もしていて、
さっきの話だったらヒューマノイドのロボットなのか自動運転AIなのかとか、
そういう個別で捉えてた方がミスリードならないようなそんな気もしますね。
そうですね。だからやっぱりハードウェアを持ってる会社がAIを搭載していくようになっているし、
既に第二世代とかもしくは深層学習、ディープラーニングレベルのものは入れてることが多いと思うんですね。
少なくともカメラとかセンサーつけていたら、そのデータを元にしての認知、認識みたいなところにAIを活用してるっていうのはたくさんあると思うんですよ。
なのでそういった企業が必然的にその次の流れとして、
生成AIとか第3、第4のAIのテクノロジーを活用していくって形になると思います。
今もやっぱり電気系のメーカーとかって普通に鉄道にしたって航空機にしたって、もっとちっちゃいようなものにしたって、みんなそういうのがあると思いますから、
そこに搭載されていくような形じゃないかなと思いますね。
フィジカルAIって言葉を使わない方がいいんじゃないかって話をしながら使っちゃう質問をするんですけど、
じゃあなんかカメラで、防犯カメラで怪しい人を、泥棒を自動検知できるAIがそのカメラに組み込まれましたと、
それはフィジカルAIになるんでしょうか?
それともAIが組み込まれた防犯カメラっていうだけの話なんでしょうか?
フィジカルAIで使われる部品の一つにはなり得ると思います。
おお、というと?
やっぱりさっき言った行動が限られてると思うんですよね、フィジカルな世界で。
できるのはあくまでもその目の機能で、それをあとはデジタル世界の方に何が起きたかを伝えることで終わっちゃってると思うんですよ。
そうではなくて、その結果としてじゃあフィジカルに何かが起きるみたいな、起こせるっていうところに繋がっていくときに、
もちろんカメラって非常に大事なんで、そのカメラがあるっていうふうにするのがいいかなと思います。
ただこれ言い出しちゃうと、ソニーのセンサーもフィジカルAIですって、もしかしたらソニーそう言ってるかもしれないんですけれど、なり得ると思うんですよ。
だから例えば今株式市場でAI銘柄っていうのがたくさんあるじゃないですか。
昔は普通にAIのフロンティアモデル作ってるとこだけだったけど、当然半導体も入ってきて、何ならAI伝査センターも入ってきて、もしくは素材のところも全部入ってきて、
電線メーカーまでAI銘柄になってるわけじゃないですか。これ全部正しいと思うんですよ、実際に。
そういう意味で言うとカメラもう十分フィジカルAIの中の一つになり得るとは思います。
ちょっとこれ無茶振りになっちゃうんですけど、中の一つじゃなくてこれはフィジカルAIだよねって言わせるには、
あと何ができたらいいんですか、さっきの防犯カメラ君は。
例えばでもカメラのところは自社でやらなかったとしても、他と組み合わせればいいと思うんですよね。
NVIDIAのことを、NVIDIAっていろんな見せ方があるし、実際いろんなことやってると思うんですけど、
NVIDIAがフィジカルAIの企業だって言われたときに、全然違うよとは言わないと思うんですよ。
でもNVIDIAが、じゃあ実際ヒューマノイドロボットまでガッツリ作ってるかと作ってなくて、
数週間前か1ヶ月前か忘れましたけど、日本のものづくり産業と提携してるじゃないですか。
あとヒタチとかとも提携してると思うんですけれども、あれはやっぱり実際のものがあるところと一緒に組むことによって、
自分たちはフィジカルAIを作るときの半導体であったり、彼らはソフトウェアスタックを持ってるんで、
ソフトウェアスタックだっていうところを部品として提供するけれども、そのハードに近いところ、ハードそのものは、
じゃあ例えば日本のものづくり産業の人たちと組みましょうってことをやるわけですよね。
こういうようなエコシステムというかプラットフォーム、自分たちだけじゃなくて他社と組み合わせて、
フィジカルAIが作れるっていうものを見せれることになったならば、
それはフィジカルAIの一部だっていうふうにはっきり自信を持って言えるんじゃないかと思います。
ちょっとこだわっちゃうんですけども、さっきのカメラの事例だと、どうしたらフィジカルAIと認定いただけますか?
何の行動が限られちゃうっていう話もありましたけど、そこにあと何のセットメニューを加えたらフィジカルAI認定をしていただけますでしょうか?
難しいですね。でもちょっとそこは私も詳しくないからわかんないんですけれども、
さっき言った認知・認識・判断・アクション、例えば判断のところまで自分たちの方でAIモデルを持っていますと、
その先で何の行動を起こすかっていうところのパターンがあって、それはもうハードウェア企業さんが繋がればいいですよっていう状況まで持っていったならば、
結構先ほどのNVIDIAに近い状態になるんじゃないかと思うんですよね。
例えばコンビニの防犯カメラで怪しい人がいて、怪しい人をもう検知して、この人は泥棒だと確定診断をして、
その人を何か手錠でガチャッと捕まえられるような行動をするんだったら、それはロボットかもしれないですけど、フィジカルAI。
そうですね。そうですね。ちょっとユースケースがあまりにもビビってこないところがあって。
私の例が悪かったんですけど。
でもそれ正しいです。いいんですよ。それがフィジカルAIなのかと言われると、何か違うなって思ったんですけど、
なぜ違うんだろうってことを考えるのはすごい大事なんだなと思いました。
素人的に考えると、人間の五感の一個しか使ってないじゃないですか、防犯カメラの泥棒か何かの判断って。
だからもう2つぐらい使うと、手なのかな、触覚とかも入り出すとフィジカルAIになってくるんですかね。
やっぱりそれはもしかしたら行動の部分かもしれないですね。
その認知認識に何を使うかっていうのは、十分に認知できさえすれば、視覚情報だけに頼るっていうことをやっても別に構わないわけです。
実際にテスラとかっていうのは、昔ライダーっていうのを入れてたけど、今はもう高速削減とか十分な品質が保てるっていうことで、
もう視覚情報しか入れてないんですよね。ビジョンコンピューティングだけにしちゃってるわけですよ。
これは賛否両論めちゃくちゃあるんですけれど、ただだからといってテスラはもう視覚情報しか使ってないから、
フィジカルAIじゃないよねっていうのは言えないと思うんですよね。
やっぱり何を認知認識のインプットにするかっていうのは、それはもう自由だと思うんですよね。
ただ一方で今山本さん言ったところはインプット側じゃなくて、実際の最終的な行動の方に関して、
ここがもうシンプルなものだと、なんか大したことやってないなって感じはあるかなと思いますね。
やっぱ行動もパターン数が少ないと急にアルゴリズムに感じるし、パターン数が有限じゃないというか、
どんなことでもあり得るんだとしたら、急にフィジカルAIっぽくなってきますよね。
あともう1個思いました。やっぱりそこに複雑性がある程度あるのを期待すると思うんですよ。
簡単な作業じゃなくて。そうすると、ある行動を起こした時にそれによって、
どういう行動を起こすかですけど、何かが変わるわけですよ。
例えば車だったならば、ハンドル切ったならば確実にとんでもないスピードで少なくとも見ている情報が変わっていき、
その結果新たに認知して判断して行動を起こしてということを素早く回さなきゃいけないわけですよね。
とか横断歩道で左に曲がったならば予想もしてなかった子供が飛び出してきたみたいなことがあった時に、
それですぐ、それもいい理由かな。左にハンドル切ったらとかですからね。
でも何かあるんだと思うんですよ。もっと言うとロボットならば何かを掴んだ時に、
その掴んだものが認知していたものと違って、すごい柔らかいものだったっていうのが分かった時に、
それを元にまたすぐに判断してどういう行動をとるかを決めなきゃいけないなと思うんですよね。
その認知、判断、行動がワンサイクルじゃなくてずっと回り続けるみたいなのが複雑性の要素かもしれないですね。
それだけじゃないかもしれないです。一つやっぱり複雑性が増して、
やっぱり今までと違うAI技術が必要になるなというところで言うと、今言ったようなケースがあるかなと思いました。
感覚アルゴリズムで動くものって、もちろんさっきの3要素のナンループもアルゴリズムに組んじゃえばできるような感覚はあるんですけども、
例え何かそんなにナンループもしないだろうなっていう一定組まれた認知、判断、行動しかできなさそうな感じがするので。
パターンに限度があるんですよね、やっぱりアルゴリズムというものには。
アルゴリズムって基本的にはルールなんで、こうなった時にはこうしようっていうことが組まれているものですからね。
ありがとうございます。
はい、ということで、追い笠に聞いてみよう第2弾は、今更聞けないフィジカルAIをお届けしてまいりました。
フィジカルAIって言葉使わない方がいいんじゃないかなとも思いつつ、きっとこの言葉が流行る限り我々は使い続けてしまうと思うので、
こんなのもフィジカルAIになってるんじゃないかっていうお声があれば、ぜひ皆様いただければなと思ってます。
あとですね、この追い笠に聞いてみようという企画を始めるにあたって10個ぐらいテーマを用意してたんですけども、
FDEとフィジカルAIで終わってしまいまして、ぜひ第2弾を追い笠にお願いしたいなと思いつつも、
皆さんの方からでもですね、今更聞けないホゲホゲ、ホニャホニャありましたら代わりに我々が素人のフリをしてというか、素人として聞いていきますので、