00:00
ポッドサイエンティストへようこそ、サトシです。 先週は、
頑張るとドーパミンの放出が増えるっていう論文の話をしたんですね。 今日はちょっとその補足で、
ドーパミンっていうのは何なのかっていう話をしていきたいと思います。 その
ドーパミンは快楽物質であるっていうような言われ方をすることがあるんですね。 だから脳の中でドーパミンが放出されると快感がもたらされるっていう、
そういう考えがあるんです。 ただこれはちょっと単純化しすぎというか、
現在のドーパミンの働きの理解から考えると不正確と言えるんですね。 ちょっと後で話していくんですけれども、長らく
ドーパミンは報酬予測誤差のシグナルであるっていう考えが主流でした。 その詳しい人はこの報酬予測誤差っていうのを聞いたことがあるかもしれないです。
しかし最近、計測技術の向上もあって、これに合わない結果っていうのも増えてきているんです。 それに伴って新しい理論っていうのも出てきていて、今日はちょっとその辺まで含めて話していきたいと思います。
まず確認なんですが、ドーパミンは神経伝達物質なんですね。
脳の中にはたくさんの神経細胞があるんですけれども、その一部がドーパミンを作ります。 こういうドーパミンを作る神経のことをドーパミン神経と呼びます。
ここからドーパミンが放出されて、細胞の外の空間に出るわけです。 それが別の細胞に作用します。
この作用される側の細胞にはドーパミン受容体っていうドーパミンと結合して情報を細胞に伝える分子っていうのがあるわけです。
まず長くわかっていたのが、報酬が得られるときにドーパミン神経が働くことが多いっていうことです。
ドーパミン神経が働けば、ドーパミンが放出されるんですね。 ここから報酬をドーパミンが伝えていると単純に考えられたわけです。
食べ物なんか含めて報酬っていうのは快楽を生むから、それでドーパミンは快楽物質だっていうことだったんですけれども、
その報酬がもたらす快楽と報酬が欲しい動機っていうのは別なんですね。
03:06
この報酬がもたらす快楽にはオピオイドが働いているっていうことがわかっています。
オピオイドっていうのは麻薬、モルヒネなんかと同じような作用がある脳内の物質で脳内麻薬なんて呼ばれたりします。
ドーパミンが何をしているかというと主に動機づけの方に働いているんです。
でももちろん動機づけがあるからその報酬を得るっていうのがあって、その結果快楽が得られるっていう点では一緒でもあるわけなんですね。
でも脳の働きを見ていくと快楽にはオピオイド、動機づけにはドーパミンっていう風になっているっていうのがだんだんわかっていったんです。
さらに報酬イコールドーパミンっていうのが怪しくなるような結果っていうのが報告されたんです。
有名な実験があって、ウォルフラム・シュルツっていう人によって行われた1997年の猿の実験です。
この実験では猿の脳の中のドーパミン神経の活動を記録しています。
報酬として猿がジュースを受け取るんですが、その時にドーパミン神経の活動がまず起きるっていうのが観察されたんですね。
これは報酬イコールドーパミンっていう、それと一致した結果なんです。
ただこの後に学習をさせます。
連合学習って呼ばれるやつで、パブロフの犬なんていうのが有名なんですけれども、刺激と報酬を連合させるような学習です。
犬の実験では餌を与える前にベルを鳴らすっていうのをやるのが有名なものとしてあるんですね。
しばらくそれを繰り返していると犬の方はベルが鳴れば餌が来るっていうのを学習するわけです。
学習してしまうとベルを聞いただけでヨダレが出るようになるんです。
猿の実験に戻りますけれども、猿の実験の方では光をつけてその後にジュースをあげるっていうことをやるんですね。
それをしばらく繰り返して学習させます。
この状態でドーパミン神経の活動を記録していくと、光がついた瞬間にドーパミン神経の活動が見られたんです。
06:01
その後ジュースを与えるわけなんですけれども、ジュースを与えた時には学習後にはドーパミン神経はあんまり活動しないっていう結果だったんです。
だから学習の前だとジュースでドーパミン神経が活動してたんだけど、学習した後は光でドーパミン神経が活動するっていう風に変わっていたんです。
この結果からドーパミンは予測との違いを伝えているっていう風に解釈されるようになりました。
まず学習前なんですけれども、ジュースはいつ来るかわからないわけです。
突然ジュースが猿に与えられて、だから予測してないタイミングで報酬が来たわけですね。
この予測とのポジティブな違いに反応してドーパミンが働くと、この理論では理解します。
学習後はまず光はいつ来るかわからないわけです。
光がつくんだけど、光がつくってことはジュースがもらえるっていうことを猿はもう理解してますから、この光がつくっていう刺激自体が予測してないプラスの報酬だっていうことになるわけですね。
これにドーパミン神経が反応していると理解できます。
その後にジュースが出るんだけど、光の後にジュースが出るっていうのはもう予測できるわけです、学習の後だと。
だから予測通りなのでドーパミンは反応しないっていうことなんですね。
だからこんなふうに報酬の予測との誤差に反応しているっていう理屈なんです。
さらにですね、学習の後に光はつけるんだけどジュースはあげないっていうのも実験としてやってみてあるんです。
その時は光をつけるとまずドーパミン神経が活動します。
その後、これまではジュースを与えていたタイミングで何が起きるかというと、
ドーパミン神経の活動がベースラインよりも減っていたんです。
その光がついた後にジュースが出ないっていうのは予測とずれているわけなんですね。
これがマイナス方向にずれているわけじゃないですか。
この場合はドーパミンが減るっていう反応が起きて、これがマイナスの予測誤差を表していると理解できるわけです。
というわけで報酬予測誤差、リワードプレディクションエラーをドーパミンは伝えているんだっていうこの考えが主流になりました。
09:14
でもその後、動物の行動をすべてこの理論で説明できるわけではないということになっていくんですね。
実験の技術が良くなっていろんなデータが取られるようになったんですが、その結果報酬予測誤差の理論に合わないものが増えていったんです。
例えば報酬がないような場合でも予測とのずれがあるとドーパミンの反応が見られたりするんですね。
ただそれでも報酬予測誤差で説明できるものが多かったですから、少しモデルを書き換えたり拡張したりすることで観察された現象を理解していくということがその後もされてきました。
しかし最近はそもそも予測誤差っていう考え自体が間違っているのではないかっていう立場の人が増えてきています。
それでドーパミンは報酬予測誤差のシグナルであるっていう理論とは違う理論がいくつか提唱されるようになりました。
ここではそのうちの一つを紹介したいと思います。
これがANCCRと呼ばれるやつなんですが、これを日本語にしてもいまいち意味がわからないんです。
ただ内容としてはドーパミンは振り返り学習に働いているっていうものです。
その報酬予測誤差の理論は報酬の予測とのずれにドーパミンは反応しているっていうことだったんですが、
ANCCRでは報酬が起きたときにその原因を遡って探すっていう学習モデルになります。
だからパブロフの犬で行くと食べ物が来るわけですね。
そうすると直前にベルが鳴っていたなと過去に遡って原因となるものを探すんです。
それでベルを餌が出た原因として学習するっていうそういう理屈になります。
この学習を促すシグナルとしてドーパミンが働いているっていう理論なんですね。
12:03
ドーパミンが何に反応しているかというと学習するに値するものに反応しているっていうことになります。
ですから報酬があるとドーパミンが放出されるんです。
それによって脳はこれが何が原因なのかっていうのを探索するわけですね。
過去にあったものが一つの手がかりとして選ばれて、その手がかりと報酬の結びつきを強化するっていう役割をドーパミンが担っているっていうことになります。
だからドーパミンは単なる報酬ではなくてその原因を探す価値のあるイベントを示す信号っていうことになるわけですね。
この理論のいいところがいくつかあって報酬予測誤算の理論では説明できなかった現象が説明できるっていうところがあるんです。
そのまず一つが報酬以外のドーパミン反応を予測できるっていうのがあります。
この理屈でいけばドーパミンは単に報酬に反応しているのではなくて、原因を探す価値のあるイベントに反応しているからっていうところになるわけですね。
それから他には報酬がランダムに与えられたときの反応なんかも説明できます。
その報酬が特に音とか光みたいな刺激なしにただランダムに出てくる場合だと報酬予測誤算のモデルでいけばドーパミンは予測とのずれに反応するっていうことになるわけですね。
それであればランダムな報酬っていうのは慣れていくはずで、ドーパミンの反応っていうのは少しずつ弱くなるはずです。
でも実際にはランダムな報酬がずっとある場合にはドーパミンの反応は変わらないか、むしろ反応が強くなるんですね。
これは報酬予測誤算の理屈では説明できないんです。
でもこの振り返り学習のモデルでいくと報酬の原因を探そうとするので、ランダムな報酬がずっとあるとそれを探し続けることになるわけです。
だとすれば、より探そうとして反応が強くなっているっていうのも説明ができるっていう形になるわけです。
この報酬予測誤算の理論と振り返り学習の理論の違いっていうのは結構細かいところであって、普通の報酬に対する反応っていうのはどちらの理論でも同じになるわけです。
15:15
なのでちょっとこの違いがわかりにくいっていうところはあります。
報酬予測誤算の理論では説明できない現象っていうのがいくつもあるんですけれども、この理論の方を補完することで全てを説明できるようにしようっていうアプローチも依然として取られてますし、振り返り学習の理論が正しいのかっていうのもまだ決着が出てないんです。
さらには他にもいくつか理論が提唱されています。
どちらであっても報酬にドーパミンが関係あるっていうのは変わらないんですが、今その基盤にある考えっていうのは議論が行われていてホットなトピックであるというところです。
今日はこれで終わりにしたいと思います。