1. ugo Robotics Radio
  2. #45_Cross Talk:ugo AI専門部..
#45_Cross Talk:ugo AI専門部隊が語る、フィジカルAIの最前線とugo novaで挑むデータ収集
2026-10-05 21:17

#45_Cross Talk:ugo AI専門部隊が語る、フィジカルAIの最前線とugo novaで挑むデータ収集

採用情報は⁠⁠⁠⁠⁠⁠⁠⁠⁠こちら⁠⁠


【今回のエピソード】

新設されたフィジカルインテリジェンス部の金子さんと小林さんをゲストに迎え、フィジカルAIの最前線を語ります。GeneralistとSkild AIの新モデル、VLAとWorld Action Modelの違い、2人から見たugo novaの評価まで話しました。自動車業界とブロックチェーン出身の2人が、データ収集からデプロイまで一貫して手がけるロボット基盤モデル開発の面白さと難しさに迫ります。


【出演者】

金子(フィジカルインテリジェンス部 部長)

小林(フィジカルインテリジェンス部)

感想

まだ感想はありません。最初の1件を書きましょう!

サマリー

ugoのフィジカルインテリジェンス部で、金子さんと小林さんがフィジカルAIの最新動向を語る。人の実演を再現するGeneralistとSkild AIのアプローチ、VLAとワールドアクションモデルの違い、推論速度や安全性の課題が紹介された。ugo novaについては、移動と操作を両立するモバイルマニピュレーターとしての利点や、ハードウェアの完成度が評価された。データ収集から学習・推論・評価・デプロイまで一貫して行う開発の面白さと、実機故障や評価環境、人材不足といった難しさも語られた。

フィジカルインテリジェンス部とゲスト紹介
皆さんこんにちは、ugo Robotics Radioのお時間です。 本日はパーソナリティとして、私松井が担当させていただきます。
今日はですね、フィジカルインテリジェンス部というugoにとってですね、ロボットを活用したフィジカルAIの社会実装をミッションにですね、データ収集からAIの基盤モデル開発まで行うですね、担当部門というのを新しく創設しまして、
このフィジカルインテリジェンス部に所属する2名の方にお越しいただいております。
ではまずフィジカルインテリジェンス部部長の金子さん、ぜひ自己紹介をお願いします。
はい、金子です。よろしくお願いします。
えっと、私は7月に入社しまして、前職では自動駐車のモデル開発を約5、6年間やっていました。
はい、で7月に入ってこの組織の立ち上げから参画しまして、実際にモデル開発とデータ収集、データ戦略というところをやっております。
はい、よろしくお願いします。
よろしくお願いします。金子さんはあれですよね、元自動車産業、自動車業界からいらっしゃって、もともとフィジカルAIって自動車から先行して進んでいたので、
そのバックグラウンドをこの次のロボティクスに生かしていくということで非常に楽しみな強力なメンバーだなと思っています。
ありがとうございます。
ぜひ頑張りたいと思います。
続きまして小林さん、自己紹介をお願いします。
小林角人です。お願いします。
えっと、私は今年の2月に入社しました。
前職ではブロックチェーンだとか、デジタルツーからとか、あと暗号とかの実装をやってました。
基本的にはウェブ上で動くものですね。ただもうちょっと社会実装をしたいなっていうのと、ハードウェアをもっと動かしたいなっていうのがあって、
今年の2月に入社しました。
今やっていることとしては、AIの方学習のデータパイプラインを作っています。
データ収集から学習推論までのパイプラインですね。
をやっています。よろしくお願いします。
ありがとうございます。よろしくお願いします。
小林さんはバックグラウンドがブロックチェーンってすごい興味深いですね。
深いですね。たまに怪しいって思われるんですけど、怪しいことはしていなかったです。
ブロックチェーンをやっていたからこそ、今のロボティクスもしくはフィジカルAIで繋がりありそうだなと思うところって何かありますか?
それは前にも松井さんに聞かれたんですけど、全く思いつかなくて。
できるだけ別の方に行きたかったっていうのがありますね。
ハードウェアは全然違いますね。
という金子さんと小林さん、強力なお二人を迎えて、
今日はフィジカルAIについてお話ししていきたいと思います。よろしくお願いします。
GeneralistとSkild AIの実演再現アプローチ
ではまずですね、昨今やっぱりフィジカルAIのニュースって毎日ように何件も出ていたり、
この界隈の研究者の発表も毎週のように新しいモデルとかアーキテクチャーが発表されてますけど、
最先端をお二人から見て、今のフィジカルAIのホットトピックっていうのはどのあたりがありますか?
じゃあ金子さんどうぞ。
そうですね、ホットトピックは一番大きいのは、
人が目の前でロボットに対してデモを行って、
それをそのままロボットが再現するというモデルが出てきたっていうのが非常に興味深いと思ってます。
これまではやっぱり事前に人間がテレオペなりデータ収集したものを学習して、
それから初めてようやくタスクを遂行するっていうところが一般的だったんですけど、
9月頃に出たので、
ジェネラリストという会社は明示的にデモ、目の前で見せたものを再現するっていう学習を意図的にしてないにもかかわらず、
大規模な事前学習を長期間継続してスケーリングさせることによって偶然創発したっていうのが出てきて非常に面白いなと思いました。
創発までいけちゃうんですね。
そうですね、自動運転の界隈でもあるタイミングを超えると、
今までできなかったことがある日突然できるっていうのがデータスケールとともにあるというのは、
日本でもチューリングさんとかでやられてたりするので、それがロボットにも来たかというところで非常に興味深いなと思っています。
ついにゼロショットで、
そうですね。
どんどん来ちゃうっていう時代が来ちゃうんですね。
そうですね、ジェネラリストの場合はそこを明示的にやってないので、まだ短いタスクですけど、
それに対照的なのがスキルドAIっていう会社で、
そこはもう最初からゼロショットで学習させるためのインコンテキストラーニングという手法を用いていて、
言語指示とかではなくて見た目のビジュアル的なものを再現するための学習をして、
同じようなことを実現しているという、
結果は一緒なんですけど別のアプローチで面白いモデルが出てきたので、
今後どっちが主流になるのかなっていうのも非常に興味深いなと思っています。
そうですね、動画の見た目ではどっちも結果としては同じように見えますけどアプローチなんか違いましたね。
アプローチが全く違いますね。
ジェネラリストはもう本当に伝統的なというとあれですけど、
よくある本当にテレオペをしたものを学習させて、言語でタスク切り替えをやるっていうところですね。
スキルドAIはもうそれではなくて画像がメインになっていて、
それに対応する動きっていうのを再現するっていうところに重きを置いているので、
そっちの方が汎用性は高いかもしれないですね。
なんかやっぱ現場目線からもすると、
この通りにやってくれっていうのを動きを見せた方が、
言葉で伝えるよりも伝えやすいじゃないですか。
そうですね、スキルドAIのブログにもまさにそのことが書いてあって、
やっぱり言語で指示できるものは限られていて、
百聞は一見にしかしないですけど、
やれば視覚的にわかることっていっぱいあるので、見せればわかることがいっぱいあるので、
そちらとある程度併用は必要かもしれないですけど、
そっちの方が身体的な動作の獲得っていう意味ではいいのかもしれないですね。
そうですよね。
VLAとワールドアクションモデル
そうするとVLAってVision Language Action Modelですけど、
ランゲージいらないんじゃね?
そうですね。
ロングホライズンのタスクをこなそうとすると、
詳細なタスク指示は不要だけど、
タスクABCを切り替えるというトリガーとしては言語があった方がいいかなと思うので、
ちょっとそこがうまくハイブリッドしていったらいいんじゃないかなという気もしますね。
確かに、タスクのセマンティックとして上位の方の推論の方でちゃんと理解できるようにつなげるためには必要ですよね。
そうですね、そう思います。
面白いですね。
ありがとうございます。
小林さんは何かホットトピックどうですか?
私はですね、やっぱりワールドアクションモデルのところかなとは思ってます。
実際に未知のタスクに関しては既存のVLAよりも精度が高いみたいな実証実験も出てますし、
あとはやっぱり今ちょっと話されてますけど、ランゲージとかがないのもあったりするので、
そこら辺は全然構造が違くて面白いっていうところですね。
ワールドアクションモデルは今までのVLAみたいな画像を見てすぐアクションを出すんじゃなくて、
次どうなるのかっていう予想、物理条件の予想とまでは行かないですけど、
ラテントアクションみたいなイメージからイメージの繋がりみたいなのを学習してやる方式ですね。
実際将来的にマスアダプションしていく上でどっちが大事かとかはちょっとわからないですけど、
一つの技術としては面白いかなと思ってます。
人間の行動も結構先を予測しながら動かしてることが多いので、すごく直感的でしょうし、
あとその先の行動を予測しながらっていうのが後でログのデータとして取れると、
何で失敗したのかというのがトレースしやすくなるんじゃないかなってそういうところにも期待がありますよね。
そうですね、面白そうですね。あとロボットハンドが違くても人間の手のデータだけでもラテントアクションとかで学べたりするので、
そこら辺は汎用的で面白いかなと思ってます。
そうですね。一方でワールドアクションモデルって未来を予測するために動画を生成するようなことをやると思うので、
結構GPU使うっていうエッジの処理の重さが結構ボトルネック、今のボトルネックになってると思うんですけど、
そのあたりはどう思います?
はい、その通りだと思います。
はい、それが現状ですね。ただ今後研究でどのくらいその推論の速度が向上していくのかというのは見物だと思います。
やっぱり我々社会実装する上でどうしても推論するときネットワークの遅延だとかボロボロの遅延考えないといけないので、
推論の速度が上がるとどうしてもロボットの動きにカクつきが出たり、
あと一回でも失敗したらやっぱりちょっと事故になりかねないので、そこら辺は慎重に考えたいなと思ってます。
そうですね。
ugo novaのモバイルマニピュレーターとしての強み
今日のお話だけでもVLAのアプローチとWAMのアプローチと、まさに今ちょうどトレンドの2つの話が出たので非常に面白いなと思いました。
優吾では優吾NOVAというのを先日発表して、ちょうどこの優吾ロボティクスラジオの前回のパートでは、
CTOの山田が優吾NOVAのハードウェアに関するいろんなこだわり、今回の特徴というのを紹介したんですけど、
まさにこのフィジカルAをやっているお二人から見て優吾NOVAってどうですか?いかがですか?
やっぱり僕もハードウェア目線からになっちゃうかもしれないですけど、やっぱりモバイルマニピュレーターっていいなって思ってまして、
結構やっぱり今の研究ってARMだけ、どうしても他の軸があると研究にならないのでやっぱりARMだけなんですけど、
今後は研究だけじゃなくて社会実装を見据えてマスアダプションしていくためにはやっぱり移動しながら制御するということが大事というか必要になってくると思うんで、
AI制御する上でもモバイルマニピュレーターっていうのは今後の社会実装を見据えた上でも開発しやすいです。嬉しいです。
やっぱりそこの導入しやすさ開発のしやすさとかその開発のスピードにも結構影響すると思うので、その点でもやっぱりメリットってあるんですかね?
かけない。
どういうことですか?
要は2脚とかだといろいろと安全性とか考えたりとか運用面でも課題が多いと思うんですけど、
モバイルマニピュレーターだとある程度固定されていると安定して動くところがあると思うので、そこの部分は気にせずにスピーディーに開発ができるっていうのはメリットになるんですかね?
はい、メリットになると思います。
やっぱりナビゲーショリングがあると土台が安定するのでマニピュレーションもしやすいですし、そこはメリットがあると思います。
一方で本当に最終的にマスターアダプションするためには、もしかしたら現場とかだと多少の段差だったりとかあるので、4脚、2脚みたいなのを考えておく必要はあるかもしれませんね。
そうですね。金子さんはいかがですか?
はい、そうですね。私から見て、まずやっぱりNOVAはハードウェアの完成度が高いなっていうのが一つポイントにあると思ってます。
はい、下半もそうですし、あと首腰の自由度もあるというところで、そこを踏まえてより人間らしい推論だったり動作っていうのをモデルで再現できるっていうところが一番のポイントかなと考えてますね。
そうですね。カメラとかもね、もともとネイティブでハンドカメラも頭にもカメラもついていて、今のフィジカルAIのロボット基盤モデルをすぐに搭載しやすい、データ収集しやすいようになっていますね。
データ収集からデプロイまでの開発現場
ありがとうございます。じゃあ、こういう融合NOVAを活用して、実際に我々データファクトリー、データ収集キットを活用してデータを収集していくっていうこともやっていってるんですけども、
このロボット基盤モデル開発に取り組んでいて、お二人どんなところが楽しいとかやりがいがあるとか逆に大変だとか、いろいろリアルをぜひお話ししていただきたいなと思いますけど、じゃあ金子さんどうですか。
そうですね。開発の面白さとしては、やっぱり実機をちゃんと動かして、自分で取ったデータを学習させてデプロイしてその検証までをできるっていうところが一番やりがいがあって面白いなと思います。
前職だと自動車産業だと産業がでかすぎて、サプライヤーで開発したモデルって車両で評価って自分たちはできないんですよ。車両を持ってないので。そこはもうOEMの仕事みたいな感じになってたので、せっかく自分たちが開発したモデルって基本事務所、PC上の評価に閉じていたので、なかなかそういう手触り感がなかったっていうのがあったんですけど、
融合に入ってからもう毎日のように積極的に張り付いて、ああでもない、こうでもないっていうのをモデル開発者だけじゃなくソフトウェアの制御周りの人だったり、メーカーの人だったり、エレキの人だったり、もうそういったいろんな人の協力できてしながら開発するっていうのが、まさにチームで開発してるって感じもあっていいですね。
そこはやっぱりロボットならではかなというふうに感じました。
そうですね。一応データ取るとこからモデルをプロセスするとこまで、そこもエンドトゥエンドで。
そうですね。なかなか日本だと少ないと思うので、ここは融合ならではかなと。
そこは楽しいですね。逆になんか大変なとことかありますか?
そうですね。大変なとこはもう裏返しになるんですけど、やはりそうですね。ハードウェアの知識だったり、やっぱり実機を動かすとちょっとしたミスでハードウェアが故障しちゃったりとかそういうこともあって、ロボットと一緒じゃないとできないことがまだ多いので、そこを開発加速するっていうところが今後のポイントかなというふうに考えています。
あとはやっぱりモデルだけじゃなくて、安定した制御の上にモデルが乗ってるような感じなので、まずそこの土台をしっかり作ってないと、モデルが悪いのか制御が悪いのか何が悪いのかもわかんなく開発がうまく進まないっていうのがあるので、まずはそこの土台をしっかりするっていうところが、ここ3ヶ月で一番難しいなというふうに感じました。
なんかフィジカルAIって一般的な生成AIと違って、やっぱり負荷逆っていうところがあると思うんですよね。環境を変えたら変わっちゃうっていうことですよね。それ戻せない。
だからデータ収集するときも金子さんひたすらネジ閉めた後のネジを自分で開けるっていう。
ひたすらやってました。
やってましたよね。
どっちがロボットかわかんないぐらい。そんな感じでしたね。
大変ですよね。
そうですね。
自動化するデータフライホイールと採用
ありがとうございます。小林さんはいかがですか?なんか楽しいところとかやりがいがあるところ、大変なところ。
そうですね。私も実は楽しいところは同じなんですけど、やっぱデータ収集から学習、推論、評価までを一貫してできるっていうところがやっぱ楽しいところですね。
結構将来的には、NOVAの台数が増えたときに台数が増えれば増えるほどデータも溜まってロボットの知能も良くなってみたいなことを目指してて、
あとはロボット自体が実際にその問題を特定してクラウドに投げて自動で考えて評価してもう一回デプロイするみたいな、そういった自動のパイプラインみたいなのができたらいいなと思ってて、
今その基盤をちょうど作り始めているので、そこがすごい将来楽しみだなっていう感じです。
そうですね。今の生成AIの方でも、RSIっていう言葉が非常にブームになってるというかニュースになってますけど、
最適的事故改善、AI自身が自分のモデルを改善していくっていう、人間が知らないどんどん賢くなっていくみたいな時代がもうなっているんですが、
フィジカルでも多分ね、ゆくゆくはそうなっていくと思いますよね。
あとは台数の問題ですかね。
データがどれだけ集まっていくかっていう、そこのパイプラインを一体に作ってデータフライホイールを作っていくという感じなんですね。
あと評価は結構難しいなって個人的には思ってますけど、
普通予想されるのがシミュレーション上で同じ環境を用意して評価するってことだと思うんですけど、
そこら辺はなかなか難しいところだと思うんで、実際データフライホイールをするときにそこら辺がボトルネックになりそうだなって思ってます。
逆に大変なところって何かありますか。
大変なところか。
やりたいことをやらせてもらっているので。
楽しい。楽しい方が勝ってるみたいな。
そうですね。
さすがですね。
人がいないことぐらいですかね。
そこはそうですね。
ちょうどいいところで言ってもらいましたね。
まさに今フィジカルインテリジェンス部採用、積極募集中、絶賛募集中でして、
フィジカルAIエンジニア、まさにロボット基盤モデル作るような人も必要ですし、
あとデータ収集をするオペレーターの方にも是非融合にジョインしていただきたいなと思っているんですが、
お二人にどういう人に来てほしいですか。
かねこさん。
そうですね。まだ部署としても立ち上がったばかりで、
フィジカルAIの事業としてもこれからっていうところで、
本当に一から決めることがめちゃくちゃ多くて、
あと先ほど話した通り、モデル開発データ収集に閉じずに、
ハードウェアだったりエレキの皆さんと協力してやるっていうことが必要になってくるので、
そこの垣根なくやれる方と、
あとは自分で課題を見つけて実装できる方っていうところを募集したいと思います。
まさにお二人ですね。
小林さんはどうですか。
私も実装できる方に是非来ていただきたいです。
やっぱり自分でPDCA回してアクションを起こせる人がいいなと思っています。
是非、我こそはと思う方は、
募集情報はですね、概要欄にリンクを貼っておりますので、
是非アクセスしてみてください。
はい、では本日のYugo Robotics Radio、
今回はPhysical Intelligence部の金子さんと小林さんをお招きしてお届けいたしました。
お二人ともありがとうございました。
ありがとうございました。
21:17

コメント

スクロール