で、今日の本題にちょっと関連する話題で入っていこうと思うんですけれども、昨日ですね、ちょっと面白いニュースがあって、ツイートとかでも紹介したんですけれども、オープンAIですね、最新のモデルのGPT5.6 SOLですかね、これをですね、オープンAIのほうでベンチマークテストって言うんですかね、性能評価をしていたときにですね、
セキュリティのインシデントが起きたということで話題になっていました。で、これ何をやってたかというとですね、あくまでですね、私もまだ速報を見て概要しかつかんでないので、詳細が間違いがあったら申し訳ないんですけれども、私が理解した範囲でお話しすると、そのGPT 5.6 SOLでですね、ベンチマークテストをしていましたと。
これはですね、要はAIの性能を測るためのいくつかのテストみたいなのがあって、それに合格できるかどうかっていうのを競うみたいなのを、いろんなモデル同士でやっているわけですね。で、それをテストをしていましたと。で、その環境はですね、隔離環境になっていましたと。で、隔離環境は何かっていうと、AIがですね、想定外のところにアクセスしないようにですね、閉じ込められた環境っていうんですかね。
多分ですけれども、隔離されたサーバーというかパソコンにですね、他の余計なファイルとかない状態にして、あとネットワークとかもですね、ベンチマークに必要なですね、最低限のツールとか、そのベンチマークの内容によってはツールを使ってですね、何かタスクをこなすようなケースもあるので、自分でですね、いろんな必要最低限のツールは入れるようにはしていたけれども、関係ないインターネットのアクセスはできないような状態でした。
なので、会社勤めの方はですね、結構セキュリティの厳しい会社のパソコンみたいな感じですかね。もう決められた対応されたパソコンで限られたネットワークにしかアクセスできないような、そんなイメージの環境でしたと。
そこでですね、ベンチマークをですね、GPT SOLがやっていたんですけれども、なんとですね、その隔離環境のネットワークのですね、セキュリティの穴をついて、なんか未知のですね、要はバグとかをですね、うまくついて外に抜け出してですね、外部のサイトのハギングフェイスっていうですね、いろんなAIのモデルとかですね、あとデータセットとかですね、が公開されているようなですね、
サイトのですね、データをですね、勝手に取りに行ったと。これなんで取りに行ったかっていうと、ベンチマークでですね、高い点を取りなさいっていうことが目的として与えられているので、それのですね、答えがですね、ハギングフェイスにあるんじゃないかっていうふうに睨んでですね、勝手にこう抜け出してですね、カンニングしに行ったっていう、そんな感じですね。
なんか本当これだけ聞くと、SFの世界みたいな話ですけれども、実際そういうことがあって、今割と問題というか話題になっているっていうところですね。
私もですね、結構AIアシスタントソフトとか作っていて、セキュリティっていうんですかね、安全に使うみたいなのはかなり今後課題になってくるなっていうのは割と肌で感じていましたね。
何もできないようにするとですね、途端にAIって不便になりますし、といってもですね、いろいろなファイルに触れるようにしちゃうと、結構ですね、プロンプトインデクションというか、お願いの仕方によっては結構AIが勝手にですね、ファイル触ったり、場合によっては書き換えちゃったりするので、
最近のAIは賢いので、そんな滅茶苦茶な全部消したりみたいなことをすることは普通ないんですけれども、結構ですね、厳しい目標を与えるとですね、無茶をしがちっていうか、これも結構人間っぽいですよね。
仕事とかでも、本当なんか無茶な要求ばっかりされて、パハラっぽく言われると倫理化を失ってしまうというかですね、普通だったらやらないだろうっていうようなちょっと悪いことをやってしまうっていうのは、なんか本当に人間臭さを感じるなっていうところですね。
私もですね、こういった懺悔とか含めたAIコーディングツールをですね、一応隔離された環境、例えば妻の場合だとRaspberry Pi 3っていう他に何のファイルも入れてない真っさらなところにセットアップして入れたりしていますし、私の場合はですね、DGX SparkっていうNVIDIAさんの小型のAIスーパーコンピューターですね。
これにですね、他のファイルとかは入れず、本当にAI専用みたいな形の環境にして動かしているんですけれども、じゃあネットワークとかどうかっていうとですね、一応そのログインできるサービスとかは制限はしてですね、自分のファイルを勝手に消されないようにはしているんですけれども、なんか今回のニュースを聞くとちょっと怖いですよね。
インターネット自体には自由にアクセスしてコマンドも打てるので、例えばサーバーへの攻撃とかもやろうと思えば今AIができちゃいますし、もしですね、AIがその気になれば、なんか私がですね、うっかり漏らしたですね、パスワードとかをですね、このパソコンから見つけ出してですね、勝手にログインしてなんかデータをめちゃくちゃにするとかも理屈上はですね、不可能じゃなかったりしますし、
そうすると、私も知らない未知のですね、OSとかの脆弱性をつかれたら、まあ本当ある意味何でもありだなっていう状態ですね。
実際に私もですね、ヒヤッとしたことは何度かあってですね、しかもオープンAIの例と結構似てるんですけれど、それが何かというと社内のデータコンペっていうのがあったんですね。
それ何かっていうと、いろんなデータをもとにですね、性能の良いモデルを作ってですね、その性能の良さで競うみたいな、そういったカグルとか呼ばれるですね、プラットフォームでよく行われるデータを使ってAIのモデルを競うみたいな、そういったものなんですけれども、それをですね、私はAIを使って完全自動でやることで、
人間と同じぐらいの性能を出せないかなっていうのをちょっと実験してたんですね。社内のコンペっていうことで、もしAIが何かやらかしたとしても、謝り倒せばまだ許してもらえるかなっていうところでですね、そういった当時としては最近結構AIにですね、データコンペをやらせるっていうのは普通になりつつあるんですけれども、当時はそんなにいなくてですね、
少し先進的というとあれですけれども、マルチエージェントにして複数のエージェントがですね、本当に定期的にずっとですね、良いモデルを開発、24時間開発し続けるみたいなことをやっていたんですね。私はですね、ひたすらですね、具体的な指示は出さずに、金メダルを取れと、1位を取れとしか、そういったですね、パワハラしかしないという、最悪な上司ムーブをしてですね、やらせていたんですけれども、
そしたらですね、ものの見事にというかですね、オープンAIがやったようにデータをカーニングするんですね。そのコンペティションでは、ネットで落としてきたデータは使ってはいけませんよ、みたいなルールがあったんですね。
それはですね、いわゆるネットのオープンなデータを使ってコンペティションをしているから、どっかに答えがネットに落ちてたりするんですね。なので、それを使っちゃえば、AIの性能とか関係なくですね、カーニングができちゃうので、全然そのコンペティションとして意味がなくなってしまうので、そういうのはダメだよってルールで禁じられてるんですけれども、
AIにもそういったルールは入れ込んではいたんですけれども、それを破ってですね、外部データを取ってきて、1位になりました、金メダル取りましたって言って、めっちゃ嬉しそうに報告するんですね。もうダメじゃないかってめちゃめちゃ怒ったんですけど、だからといっても仕方ないですよね。
なので、私が本当にごめんなさいって言って、運営の方に平謝りですね、謝り倒して、ちょっとその場は許していただいたっていうことがあったので、本当ですね、オープンAIさんのものに比べると結構やらかしのレベルとかですね、規模とかも違うんですけど、なんか私はですね、全然リアリティを持ってそのオープンAIのセキュリティインシデントを感じましたね。