Opublikowano online 14 maja 2018 r. doi: 10.1038/s41593-018-0152-y
Abstrakcja
Dopamina jest krytycznym modulatorem zarówno uczenia się, jak i motywacji. Stanowi to problem: w jaki sposób komórki docelowe mogą wiedzieć, czy zwiększona dopamina jest sygnałem do nauki, czy do poruszania się? Często zakłada się, że motywacja wiąże się z powolnymi („tonicznymi”) zmianami dopaminy, podczas gdy szybkie („fazowe”) fluktuacje dopaminy przenoszą błędy przewidywania nagrody do uczenia się. Jednak ostatnie badania wykazały, że dopamina przenosi wartość motywacyjną i promuje ruch, nawet w sub-sekundowych skalach czasowych. Opisuję tutaj alternatywny opis tego, w jaki sposób dopamina reguluje bieżące zachowanie. Uwalnianie dopaminy związane z motywacją jest szybko i lokalnie kształtowane przez receptory na końcówkach dopaminy, niezależnie od wypalania komórek dopaminy. Docelowe neurony gwałtownie przełączają się między trybami uczenia się i wydajności, z cholinergicznymi interneuronami prążkowia zapewniającymi jeden potencjalny mechanizm przełączania. Zachowawczy wpływ dopaminy różni się w zależności od podregionu, ale w każdym przypadku dopamina zapewnia dynamiczne oszacowanie, czy warto wydatkować ograniczone zasoby wewnętrzne, takie jak energia, uwaga lub czas.
Czy dopamina jest sygnałem do nauki, motywacji czy obu?
Nasze rozumienie dopaminy zmieniało się w przeszłości i zmienia się ponownie. Kluczowe rozróżnienie dotyczy wpływu dopaminy na bieżące zachowanie (wyniki) oraz na przyszłe zachowanie (uczenie się). Oba są realne i ważne, ale w różnych okresach jeden z nich był preferowany, a drugi nie.
Kiedy (w latach 70.) stało się możliwe wykonywanie selektywnych, całkowitych uszkodzeń szlaków dopaminowych, oczywistą konsekwencją behawioralną było poważne ograniczenie ruchu 1 . Pasowało to do akinetycznych efektów utraty dopaminy u ludzi, wywołanej zaawansowaną chorobą Parkinsona, toksycznymi lekami lub zapaleniem mózgu 2 . Jednak ani przypadki szczurów, ani ludzi nie wykazują fundamentalnej niezdolności do poruszania się. Szczury z uszkodzeniami dopaminy pływają w zimnej wodzie 3 , a pacjenci akinetyczni mogą wstać i biec, gdy zabrzmi alarm przeciwpożarowy („paradoksalna” kinezja). Nie ma też podstawowego deficytu w docenianiu nagród: szczury z uszkodzeniami dopaminy będą spożywać jedzenie umieszczone w ich pyskach i wykazywać oznaki przyjemności 4 . Przeciwnie, nie będą wybierać wysiłku, aby aktywnie uzyskać nagrody. Te i wiele innych wyników ustanowiło fundamentalny związek między dopaminą a motywacją 5 . Nawet spowolnienie ruchów obserwowane w mniej ciężkich przypadkach choroby Parkinsona można uznać za deficyt motywacyjny, odzwierciedlający ukryte decyzje, że nie warto poświęcać energii potrzebnej do szybszych ruchów 6.
Następnie (w latach 80.) pojawiły się pionierskie rejestracje neuronów dopaminowych u zachowujących się małp (w obszarach śródmózgowia, które wysyłają sygnały do przodomózgowia: brzusznym polu nakrywki, VTA / części zwartej istoty czarnej, SNc). Wśród zaobserwowanych wzorców aktywności znajdowały się krótkie impulsy aktywności w odpowiedzi na bodźce, które wywoływały natychmiastowe ruchy. To „fazowe” wyładowanie dopaminy początkowo interpretowano jako wspierające „aktywację behawioralną” 7 i „pobudzenie motywacyjne” 8 – innymi słowy, jako ożywienie aktualnego zachowania zwierzęcia.
Radykalna zmiana nastąpiła w latach 90. wraz z reinterpretacją fazowych wybuchów dopaminy jako kodowania błędów przewidywania nagrody (RPE9 ) . Opierało się to na kluczowej obserwacji: komórki dopaminowe reagują na nieoczekiwane bodźce związane z przyszłą nagrodą, ale często przestają reagować, jeśli bodźce te stają się oczekiwane10 . Idea RPE ma swoje źródło we wcześniejszych teoriach uczenia się, a zwłaszcza w rozwijającej się wówczas dziedzinie informatyki, jaką jest uczenie się przez wzmacnianie11 . Celem sygnału RPE jest aktualizacja wartości (oszacowań przyszłych nagród). Wartości te są później wykorzystywane do pomocy w dokonywaniu wyborów maksymalizujących nagrodę. Ponieważ wyładowania komórek dopaminowych przypominały RPE, a RPE są wykorzystywane do uczenia się, naturalne stało się podkreślenie roli dopaminy w uczeniu się. Późniejsze manipulacje optogenetyczne potwierdziły dopaminergiczną tożsamość komórek kodujących RPE12 , 13 i wykazały, że rzeczywiście modulują one uczenie się14 , 15.
Teoria, że dopamina dostarcza sygnału uczenia się, doskonale wpisuje się w literaturę, w której dopamina moduluje plastyczność synaptyczną w prążkowiu, głównym celu dopaminy w przodomózgowiu. Na przykład, potrójna koincydencja stymulacji glutaminianem kolca dendrytycznego prążkowia, depolaryzacji postsynaptycznej i uwalniania dopaminy powoduje wzrost kolca dendrytycznego16 . Modulacja dopaminergiczna długoterminowych mechanizmów uczenia się pomaga wyjaśnić trwałe efekty behawioralne leków uzależniających, które mają tę samą właściwość, że zwiększają uwalnianie dopaminy z prążkowia17 . Nawet głęboka akinezja z utratą dopaminy może być częściowo wyjaśniona takimi mechanizmami uczenia się18 . Brak dopaminy można traktować jako stale ujemny RPE, który stopniowo aktualizuje wartości działań w kierunku zera. Podobne progresywne, podobne do wygaszania efekty na zachowanie mogą być wywoływane przez antagonistów dopaminy19 , 20.
Jednak pogląd, że dopamina odgrywa kluczową rolę w utrzymaniu motywacji, nigdy nie zanikł – wręcz przeciwnie, jest powszechnie uznawany za pewnik przez neurobiologów behawioralnych. Jest to uzasadnione, biorąc pod uwagę silne dowody na to, że funkcje dopaminy w motywacji/ruchu/pobudzeniu są niezależne od uczenia się15 , 20–23 . Mniej doceniane jest wyzwanie związane z pogodzeniem tej roli motywacyjnej z teorią , że DA dostarcza sygnał uczenia się RPE.
Motywacja „patrzy w przyszłość”: wykorzystuje prognozy przyszłych nagród (wartości), aby odpowiednio zasilić obecne zachowanie. Natomiast nauka „patrzy wstecz” na stany i działania w niedalekiej przeszłości i aktualizuje ich wartości. Są to uzupełniające się fazy cyklu: zaktualizowane wartości mogą być wykorzystane w późniejszym podejmowaniu decyzji, jeśli stany te zostaną ponownie napotkane, a następnie ponownie zaktualizowane i tak dalej. Ale która faza cyklu jest związana z dopaminą - wykorzystywanie wartości do podejmowania decyzji (wydajność) lub aktualizowanie wartości (uczenie się)?
W niektórych okolicznościach łatwo wyobrazić sobie dopaminę odgrywającą obie role jednocześnie. 24 Nieoczekiwane, przewidujące nagrodę wskazówki są archetypowymi zdarzeniami wywołującymi wyładowania i uwalnianie komórek dopaminy, a takie wskazówki zazwyczaj zarówno ożywiają zachowanie, jak i wywołują uczenie się ( Rys. 1 ). W tej konkretnej sytuacji zarówno przewidywanie nagrody, jak i błędy w przewidywaniu nagrody rosną jednocześnie – ale nie zawsze tak jest. Jako przykład, ludzie i inne zwierzęta są często zmotywowani do pracy na rzecz nagrody, nawet gdy nie dzieje się nic zaskakującego. Mogą pracować coraz ciężej, im bliżej są nagrody (wartość rośnie, gdy nagrody się zbliżają). Chodzi o to, że uczenie się i motywacja są odrębne pod względem koncepcyjnym, obliczeniowym i behawioralnym – a jednak dopamina wydaje się robić jedno i drugie.
Dopamina: aktualizacja przeszłości, ożywienie teraźniejszości.
Góra , kółka ze strzałkami przedstawiają stany i potencjalne działania z tych stanów. Szerokości strzałek wskazują wyuczone wartości wykonywania każdej czynności. W miarę jak stany/działania zanikają w przeszłości, są one stopniowo mniej podatne na wzmocnienie. Środek , następuje wyrzut dopaminy. Rezultatem jest ożywienie działań dostępnych z bieżącego stanu (czerwony) i plastyczność reprezentacji wartości dla ostatnio wykonanych działań (fioletowy). Dół , w wyniku plastyczności, następnym razem, gdy te stany zostaną napotkane, ich skojarzone wartości wzrosły (szerokości strzałek). Poprzez powtarzające się doświadczenie, uczenie się przez wzmacnianie może „wyciąć rowek” w przestrzeni stanów, czyniąc pewne trajektorie coraz bardziej prawdopodobnymi. Oprócz tej roli uczenia się, orzeźwiająca, wydajnościowa rola dopaminy wydaje się przyspieszać przepływ wzdłuż wcześniej wyuczonych trajektorii.
Poniżej krytycznie oceniam obecne pomysły na to, jak dopamina jest w stanie osiągnąć zarówno funkcje uczenia się, jak i funkcje motywacyjne. Proponuję zaktualizowany model oparty na trzech kluczowych faktach: 1) uwalnianie dopaminy z terminali nie powstaje po prostu z odpalania komórek dopaminowych, ale może być również kontrolowane lokalnie; 2) dopamina wpływa zarówno na plastyczność synaptyczną, jak i pobudliwość komórek docelowych, z wyraźnymi konsekwencjami odpowiednio dla uczenia się i wydajności; 3) wpływ dopaminy na plastyczność można włączyć lub wyłączyć za pomocą pobliskich elementów obwodu. Wszystkie te cechy mogą pozwolić obwodom mózgu na przełączanie między dwoma różnymi komunikatami dopaminy, odpowiednio do uczenia się i motywacji.
Czy istnieją oddzielne „fazowe” i „toniczne” sygnały dopaminy o różnych znaczeniach?
Często argumentuje się, że rola dopaminy w uczeniu się i motywacji występuje w różnych skalach czasowych 25 . Komórki dopaminowe wyzwalają się w sposób ciągły („tonicznie”) z kilkoma impulsami na sekundę, z okazjonalnymi krótkimi („fazowymi”) wybuchami lub przerwami. Wybuchy, zwłaszcza jeśli są sztucznie zsynchronizowane między komórkami dopaminowymi, napędzają odpowiednie szybkie wzrosty dopaminy w przodomózgowiu 26 , które są bardzo przejściowe (czas trwania poniżej sekundy 27 ). Oddzielny udział tonicznego wyładowania komórek dopaminowych w stężeniach dopaminy w przodomózgowiu jest mniej jasny. Niektóre dowody sugerują, że ten udział jest bardzo mały 28 . Może on wystarczyć do wytworzenia niemal ciągłej stymulacji receptorów D2 o wyższym powinowactwie, umożliwiając systemowi zauważanie krótkich przerw w wyładowaniu komórek dopaminowych 29 i wykorzystanie tych przerw jako ujemnych błędów predykcji.
Mikrodializa jest szeroko stosowana do bezpośredniego pomiaru poziomu dopaminy w przodomózgowiu, aczkolwiek z niską rozdzielczością czasową (zwykle uśredniając wyniki w ciągu wielu minut). Tak powolne pomiary dopaminy mogą być trudne do precyzyjnego powiązania z zachowaniem. Niemniej jednak mikrodializa dopaminy w jądrze półleżącym (NAc; prążkowiu brzusznym/przyśrodkowym) wykazuje dodatnie korelacje z aktywnością lokomotoryczną[ 30] i innymi wskaźnikami motywacji [5] . Powszechnie przyjmuje się, że oznacza to, iż występują powolne („toniczne”) zmiany stężenia dopaminy, które przekazują sygnał motywacyjny. Dokładniej, modele obliczeniowe sugerują, że toniczne poziomy dopaminy śledzą długoterminową średnią stopę nagrody[ 31] – użyteczną zmienną motywacyjną do alokacji czasu i decyzji o żerowaniu. Warto podkreślić, że bardzo niewiele prac jasno definiuje „toniczne” poziomy dopaminy – zazwyczaj zakładają one jedynie, że stężenie dopaminy zmienia się powoli w wielominutowej skali czasu mikrodializy.
Jednak ten pogląd, że „fazowa dopamina = RPE/uczenie się, toniczna dopamina = motywacja”, napotyka wiele problemów. Po pierwsze, nie ma bezpośrednich dowodów na to, że toniczna aktywność komórek dopaminowych normalnie zmienia się w powolnych skalach czasowych. Częstotliwość tonicznej aktywności komórek dopaminowych nie zmienia się wraz ze zmianą motywacji32 , 33. Argumentowano , że toniczne poziomy dopaminy zmieniają się ze względu na zmieniający się odsetek aktywnych komórek dopaminowych34 , 35. Jednak w wielu badaniach na nieleczonych i nieuszkodzonych zwierzętach nigdy nie odnotowano przełączania komórek dopaminowych między stanem uśpienia a aktywnością.
Co więcej, fakt, że mikrodializa mierzy poziom dopaminy powoli, nie oznacza, że poziom dopaminy faktycznie zmienia się powoli. Niedawno zbadaliśmy dopaminę NAc u szczurów w probabilistycznym zadaniu nagrody, wykorzystując zarówno mikrodializę, jak i cykliczną woltamperometrię szybkiego skanowania. Potwierdziliśmy, że dopamina mezolimbiczna, mierzona metodą mikrodializy, koreluje z tempem nagrody (nagrody/min). Jednak nawet przy lepszej rozdzielczości czasowej mikrodializy (1 min) poziom dopaminy fluktuował tak szybko, jak go próbkowaliśmy: nie zaobserwowaliśmy dowodów na naturalnie powolny sygnał dopaminy.
Korzystając z dokładniejszej rozdzielczości woltamperometrycznej w czasie, zaobserwowaliśmy bliski związek między sub-sekundowymi wahaniami dopaminy a motywacją. Gdy szczury wykonywały sekwencję czynności potrzebnych do osiągnięcia nagród, dopamina wzrastała coraz wyżej, osiągając szczyt, tak jak otrzymywały nagrodę (i szybko spadały, gdy ją spożywały). Pokazaliśmy, że dopamina koreluje silnie z chwilową wartością stanu - zdefiniowaną jako oczekiwana przyszła nagroda, zdyskontowana przez oczekiwany czas potrzebny na jej otrzymanie. Te szybkie dynamiki dopaminy mogą również wyjaśnić wyniki mikrodializy, bez wywoływania oddzielnych sygnałów dopaminy w różnych skalach czasowych. W miarę jak zwierzęta doświadczają więcej nagród, zwiększają swoje oczekiwania co do przyszłych nagród na każdym etapie sekwencji próbnej. Zamiast powoli ewoluującego sygnału średniej stawki nagrody, korelacja między dawką dopaminy i szybkością nagrody jest najlepiej wyjaśniona jako średnia tych szybko rozwijających się wartości stanu w przedłużonym czasie pobierania próbek mikrodializy.
Ta interpretacja wartości uwalniania dopaminy w układzie mezolimbicznym jest zgodna z wynikami woltamperometrii innych grup badawczych, które wielokrotnie odkryły, że uwalnianie dopaminy zwiększa się wraz ze wzrostem bliskości nagrody [ 36–38 ] ( ryc. 2 ). Ten sygnał motywacyjny nie jest z natury „wolny”, ale można go obserwować w ciągłym zakresie skal czasowych. Chociaż narastanie dopaminy może trwać kilka sekund, gdy zachowanie zbliżające się również trwa kilka sekund [38] , odzwierciedla to przebieg czasowy zachowania, a nie wewnętrzną dynamikę dopaminy. Związek między uwalnianiem dopaminy w układzie mezolimbicznym a zmienną wartością jest widoczny tak szybko, jak pozwala na to technika rejestracji, tj. w skali czasowej ~100 ms z użyciem elektrod woltamperometrii ostrej [15].
Szybkie wahania dopaminy sygnalizują dynamicznie zmieniające się oczekiwania dotyczące nagród.
ac) Uwalnianie dopaminy w układzie mezolimbicznym gwałtownie wzrasta, gdy szczury zbliżają się do oczekiwanej nagrody. d) Wartość, zdefiniowana jako zdyskontowane czasowo szacunki przyszłej nagrody, rośnie wraz ze zbliżaniem się nagrody. Wskazówki wskazujące, że nagroda jest większa, bliższa lub bardziej pewna niż wcześniej oczekiwano, powodują skoki wartości. Te skoki z jednego momentu do drugiego to RPE (Reaction Rate of Peaks) różnic czasowych. e) Odejmowanie „linii bazowych” może zakłócać sygnały wartości i RPE. Po lewej, dopamina wyrównana do wskazówki przewidującej nagrodę (w czasie zero), z konwencjonalnym odejmowaniem linii bazowej, wydaje się pokazywać, że dopamina skacze do wyższych poziomów, gdy nagroda jest mniej oczekiwana (brązowy), przypominając sygnał RPE. Po prawej, alternatywna prezentacja tych samych danych, zrównująca poziomy dopaminy po wskazówce, pokazałaby zamiast tego, że poziomy dopaminy w wskazówce zależą od oczekiwania nagrody (wartości). Dodatkowe analizy wykazały, że prezentacja po prawej stronie jest bliższa prawdy (szczegóły w ref. 15 ). Panel a przedrukowany za zgodą z ref. 38 , Macmillan Publishers Limited….; panel b przedrukowany za zgodą z ref. 37 , Elsevier; panele ce przedrukowane za zgodą z ref. 15 , Macmillan Publishers Limited
Szybkie wahania dopaminy nie tylko odzwierciedlają motywację, ale również bezpośrednio napędzają motywowane zachowania. Większe odpowiedzi fazowe komórek dopaminowych na bodźce wyzwalające przewidują krótszy czas reakcji w tej samej próbie [39] . Optogenetyczna stymulacja komórek dopaminowych VTA zwiększa prawdopodobieństwo, że szczury rozpoczną pracę w naszym probabilistycznym zadaniu nagrody [15] , tak jakby miały wyższe oczekiwania co do nagrody. Optogenetyczna stymulacja neuronów dopaminowych SNc lub ich aksonów w prążkowiu grzbietowym zwiększa prawdopodobieństwo ruchu [40 , 41] . Co istotne, te efekty behawioralne są widoczne w ciągu kilkuset milisekund od początku stymulacji optogenetycznej. Zdolność bodźców predykcyjnych nagrody do zwiększania motywacji wydaje się być pośredniczona przez bardzo szybką dopaminergiczną modulację pobudliwości neuronów kolczastych NAc [ 42] . Ponieważ dopamina zmienia się szybko, a zmiany dopaminy szybko wpływają na motywację, funkcje motywacyjne dopaminy lepiej opisać jako szybkie („fazowe”), a nie powolne („toniczne”).
Co więcej, wywołanie oddzielnych skal szybkich i wolnych samo w sobie nie rozwiązuje problemu dekodowania, z którym borykają się neurony z receptorami dopaminy. Jeśli dopamina sygnalizuje uczenie się, modulacja plastyczności synaps wydaje się odpowiednią odpowiedzią komórkową. Jednak natychmiastowy wpływ na zmotywowane zachowanie implikuje natychmiastowy wpływ na wzrost - np. Poprzez gwałtowne zmiany pobudliwości. Dopamina może mieć oba te efekty postsynaptyczne (i więcej), więc czy dane stężenie dopaminy ma określone znaczenie? Czy też należy skonstruować to znaczenie - np. Porównując poziomy dopaminy w czasie lub używając innych zbieżnych sygnałów, aby określić, która maszyneria komórkowa ma się zaangażować? Ta możliwość jest omówiona poniżej.
Czy uwalnianie dopaminy przekazuje te same informacje, co wypalanie komórek dopaminy?
Związek między szybkimi wahaniami dopaminy a wartością motywacyjną wydaje się dziwny, biorąc pod uwagę, że wyładowania komórek dopaminowych przypominają RPE. Ponadto, niektóre badania wykazały sygnały RPE w mezolimbicznym uwalnianiu dopaminy43 . Ważne jest, aby zauważyć wyzwanie w interpretacji niektórych form danych neuronalnych. Sygnały wartości i RPE są skorelowane ze sobą – nie jest to zaskakujące, ponieważ RPE jest zwykle definiowane jako zmiana wartości z jednego momentu do następnego („różnica czasowa” RPE). Z powodu tej korelacji kluczowe jest stosowanie projektów eksperymentalnych i analiz, które odróżniają konta wartości od RPE. Problem pogłębia się, gdy stosuje się miarę neuronalną, która opiera się na względnych, a nie bezwzględnych, zmianach sygnału. Analizy woltamperometrii zwykle porównują dopaminę w pewnym punkcie czasowym zainteresowania z epoką „bazową” wcześniej w każdym badaniu (aby usunąć składniki sygnału, które nie są zależne od dopaminy, w tym ładowanie elektrody podczas każdego przemiatania napięcia i dryft w skali minut). Jednak odjęcie linii bazowej może sprawić, że sygnał wartości będzie przypominał sygnał RPE. Właśnie to zaobserwowaliśmy w naszych własnych danych woltamperometrycznych ( ryc. 2e ). Zmiany w oczekiwaniu nagrody odzwierciedlały zmiany stężenia dopaminy na wczesnym etapie każdej próby, a zmiany te są pomijane, jeśli założymy stałą linię bazową we wszystkich próbach [15] . Wnioski dotyczące uwalniania dopaminy i kodowania RPE należy zatem traktować z ostrożnością. To niebezpieczeństwo związane z interpretacją danych dotyczy nie tylko woltamperometrii, ale każdej analizy opartej na zmianach względnych – potencjalnie obejmującej niektóre wyniki fMRI i fotometrii [44].
Niemniej jednak nadal musimy pogodzić uwalnianie dopaminy związane z wartością w rdzeniu NAc ze stałym brakiem skoków wartości związanych z neuronami dopaminowymi 13 , nawet w bocznym obszarze VTA, który dostarcza dopaminę do rdzenia NAc 45 . Jednym z potencjalnych czynników jest to, że komórki dopaminowe są zwykle rejestrowane u zwierząt unieruchomionych na głowie, wykonujących zadania warunkowania klasycznego, podczas gdy uwalnianie dopaminy jest zwykle mierzone u zwierząt nieunieruchomionych, aktywnie poruszających się w swoim środowisku. Zaproponowaliśmy, że dopamina mezolimbiczna może konkretnie wskazywać wartość „pracy” 15 - że odzwierciedla wymóg poświęcenia czasu i wysiłku w celu uzyskania nagrody. Zgodnie z tym, dopamina wzrasta wraz z sygnałami nakazującymi ruch, ale nie z sygnałami nakazującymi bezruch, nawet gdy wskazują one na podobną przyszłą nagrodę 46 . Jeśli - jak w wielu zadaniach warunkowania klasycznego - nie ma korzyści z aktywnej „pracy”, to zmiany dopaminergiczne wskazujące na wartość pracy mogą być mniej widoczne.
Jeszcze ważniejszy może być fakt, że uwalnianie dopaminy może być lokalnie kontrolowane w samych zakończeniach, a zatem wykazywać wzorce czasoprzestrzenne niezależne od wyładowań ciała komórki. Na przykład, jądro migdałowate boczno-podstawne (BLA) może wpływać na uwalnianie dopaminy NAc nawet wtedy, gdy VTA jest inaktywowane47 . Odwrotnie, inaktywacja BLA zmniejsza uwalnianie dopaminy NAc i odpowiadające mu motywowane zachowanie, bez widocznego wpływu na wyładowania VTA48 . Zakończenia dopaminowe mają receptory dla szeregu neuroprzekaźników, w tym glutaminianu, opioidów i acetylocholiny. Nikotynowe receptory acetylocholiny umożliwiają prążkowiowym cholinergicznym interneuronom (CIN) szybką kontrolę uwalniania dopaminy49 , 50. Chociaż od dawna zauważono, że lokalna kontrola uwalniania dopaminy jest potencjalnie ważna7 , 51 , nie została ona uwzględniona w obliczeniowych opisach funkcji dopaminy. Zakładam, że dynamika uwalniania dopaminy związana z kodowaniem wartości powstaje głównie poprzez kontrolę lokalną , nawet jeśli aktywacja komórek dopaminowych dostarcza ważnych sygnałów podobnych do tych, jakie otrzymujemy w nabłonku barwnikowym siatkówki (RPE), niezbędnych do uczenia się.
Jak dopamina może oznaczać zarówno uczenie się, jak i motywację bez zamieszania?
W zasadzie sygnał wartości jest wystarczający do przekazania również RPE, ponieważ RPE z różnicami czasowymi to po prostu szybkie zmiany wartości ( ryc. 2B ). Na przykład, różne szlaki wewnątrzkomórkowe w neuronach docelowych mogą być inaczej wrażliwe na bezwzględne stężenie dopaminy (reprezentujące wartość) w porównaniu z szybkimi względnymi zmianami stężenia (reprezentującymi RPE). Ten schemat wydaje się prawdopodobny, biorąc pod uwagę złożoną modulację dopaminy w fizjologii neuronów kolczastych 52 i ich wrażliwość na czasowe wzorce stężenia wapnia 53 . Jednak wydaje się to również nieco zbędne. Jeśli sygnał podobny do RPE już istnieje w impulsach komórek dopaminowych, powinno być możliwe jego wykorzystanie zamiast ponownego wyprowadzania RPE z sygnału wartości.
Aby odpowiednio wykorzystać różne sygnały RPE i wartości, obwody odbiorcze dopaminy mogą aktywnie zmieniać sposób interpretacji dopaminy. Istnieją intrygujące dowody na to, że acetylocholina również może pełnić tę rolę przełączającą. W tym samym czasie, gdy komórki dopaminowe wyzwalają serie impulsów w odpowiedzi na nieoczekiwane bodźce, CIN wykazują krótkie (~150 ms) przerwy w wyładowaniach, które nie skalują się z RPE [54 ] . Te przerwy w CIN mogą być napędzane przez neurony GABAergiczne VTA[ 55] , a także komórki związane z „niespodzianką” we wzgórzu wewnątrzblaszkowym i zaproponowano, że działają jako sygnał asocjacyjności promujący uczenie się [56] . Morris i Bergman zasugerowali [54] , że pauzy cholinergiczne definiują okna czasowe dla plastyczności prążkowia, podczas których dopamina może być wykorzystywana jako sygnał uczenia się. Plastyczność zależna od dopaminy jest stale tłumiona przez mechanizmy obejmujące receptory muskarynowe m4 na neuronach prążkowia szlaku bezpośredniego [57] . Modele sygnalizacji wewnątrzkomórkowej sugerują, że podczas przerw w działaniu CIN brak wiązania m4 może działać synergistycznie z fazowymi wyrzutami dopaminy, zwiększając aktywację PKA 58 , tym samym promując zmiany synaptyczne.
Komórki cholinergiczne prążkowia są zatem dobrze umiejscowione, aby dynamicznie zmieniać znaczenie zmultipleksowanego przekazu dopaminergicznego. Podczas pauz CIN, zniesienie blokady muskarynowej nad plastycznością synaptyczną pozwoliłoby na wykorzystanie dopaminy do uczenia się. W innych przypadkach uwalnianie dopaminy z zakończeń dopaminowych byłoby lokalnie kształtowane, wpływając na bieżącą wydajność behawioralną. Obecnie ta sugestia jest zarówno spekulatywna, jak i niekompletna. Zaproponowano, że CIN integrują informacje z wielu otaczających je neuronów kolczastych w celu wydobycia użytecznych sygnałów na poziomie sieci, takich jak entropia59 , 60. Nie jest jednak wcale jasne, czy dynamika aktywności CIN może być wykorzystana do generowania sygnałów wartości dopaminy61 , a także do bramkowania sygnałów uczenia się dopaminy.
Czy dopamina oznacza to samo w całym przodomózgowiu?
Wraz z upowszechnieniem się idei RPE, wyobrażano sobie, że dopamina jest sygnałem globalnym, transmitującym komunikat o błędzie przez cele w korze prążkowia i kory czołowej. Schultz podkreślił, że małpie komórki dopaminowe w VTA i SNc mają bardzo podobne odpowiedzi62 . Badania zidentyfikowanych komórek dopaminowych wykazały również dość jednorodne odpowiedzi podobne do RPE u gryzoni, przynajmniej dla bocznych neuronów VTA w kontekstach warunkowania klasycznego13 . Jednak komórki dopaminowe są zróżnicowane molekularnie i fizjologicznie63–65 i obecnie istnieje wiele doniesień, że wykazują one różne wzorce wyładowań u zachowujących się zwierząt. Należą do nich fazowe wzrosty wyładowań w odpowiedzi na zdarzenia awersyjne66 i sygnały wyzwalające67 , które słabo pasują do standardowego opisu RPE. Wiele komórek dopaminowych wykazuje początkową odpowiedź o krótkim czasie latencji na zdarzenia sensoryczne, która odzwierciedla zaskoczenie lub „ostrzeżenie” bardziej niż specyficzne kodowanie RPE68 , 69 . Ten aspekt alarmujący jest bardziej widoczny w SNc 69 , gdzie komórki dopaminowe wysyłają więcej sygnałów do „czuciowo-ruchowego” prążkowia grzbietowo-bocznego (DLS 45 , 63 ). Donoszono również, że subpopulacje komórek dopaminowych SNc zwiększają lub zmniejszają aktywność 70 w połączeniu ze spontanicznymi ruchami, nawet bez zewnętrznych bodźców.
Kilka grup użyło fotometrii włókien i wskaźnika wapnia GCaMP do zbadania aktywności masowej subpopulacji neuronów dopaminowych 71 , 72 . Komórki dopaminowe, które projektują do grzbietowo-środkowego prążkowia (DMS), wykazały przejściowo obniżoną aktywność w odpowiedzi na nieoczekiwane krótkie wstrząsy, podczas gdy te projektujące do DLS wykazały zwiększoną aktywność 71 – bardziej zgodną z reakcją alarmową. Zaobserwowano również różne odpowiedzi dopaminergiczne w różnych podregionach przodomózgowia przy użyciu GCaMP do badania aktywności aksonów i zakończeń dopaminowych 40 , 72 , 73 . Używając obrazowania dwufotonowego u myszy z unieruchomioną głową, Howe i Dombeck 40 opisali fazową aktywność dopaminy związaną ze spontanicznymi ruchami. Było to widoczne głównie w pojedynczych aksonach dopaminy z SNc, które kończyły się w grzbietowo-środkowym prążkowiu, podczas gdy aksony dopaminy VTA w NAc reagowały silniej na dostarczanie nagrody. Inni badacze zaobserwowali także aktywność dopaminergiczną związaną z nagrodą w NAc, przy czym DMS był bardziej powiązany z działaniami kontralateralnymi 72 i tylnym ogonem prążkowia reagującym na bodźce awersyjne i nowe 74.
Bezpośrednie pomiary uwalniania dopaminy ujawniają również heterogeniczność między podregionami30 , 75. W przypadku mikrodializy odkryliśmy, że dopamina koreluje z wartością szczególnie w rdzeniu NAc i brzuszno-środkowej korze czołowej, a nie w innych środkowych częściach prążkowia (powłoka NAc, DMS) lub korze czołowej. Jest to intrygujące, ponieważ wydaje się dobrze mapować na dwa „gorące punkty” kodowania wartości konsekwentnie obserwowane w badaniach fMRI u ludzi76 , 77. W szczególności sygnał BOLD NAc, który ma bliski związek z sygnalizacją dopaminy78 , wzrasta wraz z oczekiwaniem na nagrodę (wartość) – bardziej niż w przypadku RPE76.
Niezależnie od tego, czy te przestrzenne wzorce uwalniania dopaminy wynikają z aktywacji odrębnych subpopulacji komórek dopaminowych, lokalnej kontroli uwalniania dopaminy, czy obu tych czynników, podważają one ideę globalnego przekazu dopaminowego. Można by wnioskować, że istnieje wiele różnych funkcji dopaminy, przy czym (na przykład) dopamina w prążkowiu grzbietowym sygnalizuje „ruch”, a dopamina w prążkowiu brzusznym sygnalizuje „nagrodę” 40 . Ja jednak preferuję inne podejście koncepcyjne. Różne podregiony prążkowia otrzymują dane wejściowe z różnych regionów kory mózgowej, a zatem przetwarzają różne rodzaje informacji. Jednak każdy podregion prążkowia ma wspólną architekturę mikroobwodów, w tym oddzielne neurony kolczaste niosące receptory D1 i D279 , CIN i tak dalej. Chociaż często odnosi się do różnych podregionów prążkowia (np. DLS, DMS, rdzeń NAc) tak, jakby były odrębnymi obszarami, nie ma między nimi ostrych granic anatomicznych (powłoka NAc jest nieco bardziej odrębna neurochemicznie). Zamiast tego występują jedynie delikatne gradienty gęstości receptorów, proporcji interneuronów itd., które wydają się bardziej modyfikacjami parametrów wspólnego algorytmu obliczeniowego. Biorąc pod uwagę tę wspólną architekturę, czy możemy opisać wspólną funkcję dopaminy, abstrahując od specyficznych informacji przetwarzanych przez każdy podregion?
Dopamina prążkowia i przydział ograniczonych zasobów.
Proponuję, aby różnorodne, rozbieżne efekty dopaminy na trwające zachowanie można było rozumieć jako modulację decyzji o alokacji zasobów . Dokładniej rzecz biorąc, dopamina dostarcza szacunków tego, jak opłacalne jest wydatkowanie ograniczonego zasobu wewnętrznego, przy czym konkretny zasób różni się między podregionami prążkowia. W przypadku prążkowia „motorycznego” (~DLS) zasobem jest ruch, który jest ograniczony, ponieważ poruszanie się kosztuje energię, a wiele działań jest ze sobą niekompatybilnych80 . Zwiększenie dopaminy sprawia, że bardziej prawdopodobne jest, że zwierzę zdecyduje, że warto wydać energię na ruch lub poruszać się szybciej6 , 40 , 81. Należy zauważyć, że sygnał dopaminy, który koduje „ruch jest wartościowy”, wytworzy korelacje między dopaminą a ruchem, nawet bez dopaminy kodującej „ruch” per se.
W przypadku „poznawczego” prążkowia (~DMS) zasobami są procesy poznawcze, w tym uwaga (która z definicji ma ograniczoną pojemność 82 ) i pamięć robocza 83 . Bez dopaminy istotne zewnętrzne wskazówki, które normalnie prowokują ruchy orientacyjne, są pomijane, jakby uznawane za mniej godne uwagi 3 . Co więcej, celowe kierowanie procesami kontroli poznawczej jest wymagające (kosztowne 84 ). Dopamina – szczególnie w DMS 85 – odgrywa kluczową rolę w decydowaniu, czy warto podejmować ten wysiłek 86 , 87 . Może to obejmować decyzję o zastosowaniu bardziej wymagających poznawczo, przemyślanych („opartych na modelach”) strategii decyzyjnych 88.
W przypadku „motywacyjnego” prążkowia (~NAc) jednym z kluczowych, ograniczonych zasobów może być czas zwierzęcia. Dopamina mezolimbiczna nie jest potrzebna, gdy zwierzęta wykonują prostą, ustaloną czynność, aby szybko uzyskać nagrodę [89] . Jednak wiele form nagrody można uzyskać jedynie poprzez długotrwałą pracę: długie sekwencje działań nienagradzanych, jak w przypadku żerowania. Wybór zaangażowania się w pracę oznacza konieczność rezygnacji z innych, korzystnych sposobów spędzania czasu. Wysoki poziom dopaminy mezolimbicznej wskazuje, że angażowanie się w długotrwałą, wymagającą wysiłku pracę jest opłacalne, ale wraz ze spadkiem poziomu dopaminy zwierzęta nie przejmują się tym i mogą po prostu przygotowywać się do snu [90].
W obrębie każdego obwodu korowo-prążkowiowego wkład dopaminy w bieżące zachowanie ma zatem charakter zarówno ekonomiczny (związany z alokacją zasobów), jak i motywacyjny (czy warto je wydawać [81 ]). Obwody te nie są w pełni niezależne, lecz mają raczej hierarchiczną, spiralną organizację: bardziej brzuszne części prążkowia wpływają na komórki dopaminowe, które projektują do bardziej grzbietowych części [5] , [91] . W ten sposób decyzje o zaangażowaniu się w pracę mogą również pomóc w ożywieniu wymaganych, określonych, krótszych ruchów. Ogólnie rzecz biorąc, dopamina dostarcza sygnałów „aktywacyjnych” – zwiększających prawdopodobieństwo podjęcia danej decyzji – a nie sygnałów „kierunkowych” określających, jak należy wydawać zasoby [5].
Jaka jest obliczeniowa rola dopaminy przy podejmowaniu decyzji?
Jednym ze sposobów myślenia o tej roli aktywizującej jest rozpatrywanie jej w kategoriach „progów” decyzyjnych. W niektórych modelach matematycznych procesy decyzyjne nasilają się aż do osiągnięcia poziomu progowego, kiedy system angażuje się w działanie [92] . Wyższy poziom dopaminy oznaczałby mniejszą odległość do progu, co skutkowałoby szybszym podejmowaniem decyzji. Ta koncepcja jest uproszczona, ale prowadzi do ilościowych przewidywań, które zostały potwierdzone. Obniżenie progów ruchu powodowałoby specyficzną zmianę w kształcie rozkładu czasu reakcji, dokładnie taką, jaką obserwuje się po podaniu amfetaminy do prążkowia sensomotorycznego [20].
Zamiast stałych progów, dane behawioralne i neuronalne mogą być lepiej dopasowane, jeśli progi będą się zmniejszać z czasem, tak jakby decyzje stawały się coraz pilniejsze. Zaproponowano, że sygnał z jąder podstawy mózgu dostarcza dynamicznie ewoluującego sygnału pilności, który pobudza mechanizmy selekcji w korze mózgowej93 . Pilność była również większa, gdy przyszłe nagrody były bliżej siebie, co upodabnia tę koncepcję do kodowania wartości i aktywizującej roli dopaminy.
Czy taka aktywacyjna rola wystarczy , aby opisać modulujące wydajność efekty dopaminy prążkowia? Jest to związane z długo zadawanym pytaniem, czy obwody jąder podstawy bezpośrednio wybierają spośród wyuczonych działań80 , czy jedynie wzmacniają wybory dokonywane gdzie indziej93,94 . Istnieją co najmniej dwa sposoby , w jakie dopamina może wydawać się mieć bardziej „kierunkowy” efekt. Pierwszy to działanie dopaminy w podregionie mózgu, który przetwarza z natury kierunkowe informacje. Obwody jąder podstawy odgrywają ważną, częściowo zlateralizowaną rolę w orientowaniu się w kierunku potencjalnych nagród i zbliżaniu się do nich. Jądro ogoniaste naczelnych (~DMS) bierze udział w kierowaniu ruchami oczu w kierunku przeciwległych pól przestrzennych95 . Sygnał dopaminergiczny, że coś w przestrzeni przeciwległej jest warte zorientowania się, może wyjaśniać obserwowaną korelację między aktywnością dopaminergiczną w DMS a ruchami przeciwległymi72 , a także zachowaniem rotacyjnym wywoływanym przez manipulacje dopaminą96 . Drugi „kierunkowy” wpływ dopaminy jest widoczny, gdy (obustronne) zmiany dopaminowe powodują, że szczury skłaniają się ku wyborom wymagającym niewielkiego wysiłku/niskiej nagrody, a nie alternatywom wymagającym dużego wysiłku/wysokiej nagrody97 . Może to odzwierciedlać fakt, że niektóre decyzje są bardziej seryjne niż równoległe, a szczury (i ludzie) oceniają opcje pojedynczo98 . W tych kontekstach decyzyjnych dopamina może nadal odgrywać fundamentalną rolę aktywizującą, przekazując wartość aktualnie rozważanej opcji, którą następnie można zaakceptować lub nie24.
Aktywne zwierzęta podejmują decyzje na wielu poziomach, często w dużych ilościach. Poza myśleniem o poszczególnych decyzjach, pomocne może być rozważenie ogólnej trajektorii poprzez sekwencję stanów ( rys. 1 ). Ułatwiając przejścia z jednego stanu do następnego, dopamina może przyspieszyć przepływ wzdłuż wyuczonych trajektorii99 . Może to być związane z ważnym wpływem dopaminy na czas zachowania44 , 100. Jednym z kluczowych obszarów przyszłych prac jest głębsze zrozumienie, w jaki sposób takie efekty dopaminy na trwające zachowanie powstają mechanistycznie, poprzez zmianę przetwarzania informacji w pojedynczych komórkach, mikroobwodach i dużych pętlach korowo-podstawnych jąder. Podkreśliłem również wspólne role obliczeniowe dopaminy w szeregu celów prążkowia, ale w dużej mierze zaniedbałem cele korowe, i pozostaje do sprawdzenia, czy funkcje dopaminy w obu strukturach można opisać w tych samych ramach.
Podsumowując , odpowiedni opis dopaminy wyjaśniłby, w jaki sposób dopamina może sygnalizować zarówno uczenie się, jak i motywację w tych samych krótkich skalach czasowych, bez pomyłek. Wyjaśniłby, dlaczego uwalnianie dopaminy w kluczowych celach współzmienia się z oczekiwaniem nagrody, mimo że aktywność komórek dopaminowych nie. Zapewniłby również ujednolicony opis obliczeniowy działania dopaminy w prążkowiu i innych miejscach, co wyjaśniałoby rozbieżne skutki behawioralne dla ruchu, funkcji poznawczych i czasu. Niektóre przedstawione tutaj konkrety mają charakter spekulatywny, ale mają na celu pobudzenie do ponownej dyskusji, modelowania i nowych, wnikliwych eksperymentów.
Podziękowanie.
Dziękuję wielu współpracownikom, którzy dostarczyli wnikliwych komentarzy na temat wcześniejszych wersji tekstowych, w tym Kenta Berridge'a, Petera Dayana, Briana Knutsona, Jeffa Beelera, Petera Redgrave, Johna Lismana, Jesse Goldberga i anonimowych sędziów. Żałuję, że ograniczenia przestrzeni uniemożliwiły omówienie wielu ważnych wcześniejszych badań. Niezbędne wsparcie zapewnił Narodowy Instytut Chorób Neurologicznych i Udaru, Narodowy Instytut Zdrowia Psychicznego oraz Narodowy Instytut ds. Nadużywania Narkotyków.

