Знания важнее награды

Кирилл Стасевич

Давно известно, что обучение и память работают при поддержке системы подкрепления, или вознаграждения. Так называют группу нервных центров мозга, благодаря которой мы чувствуем удовольствие от награды. Строго говоря, система подкрепления обеспечивает не столько само удовольствие, сколько предвкушение того, что мы получим нечто приятное за выполнение определённых действий. Поэтому значение её намного шире — от неё зависит любая мотивация, в том числе и мотивация к обучению. Награда же может быть какой угодно. Мышь, запоминающая устройство лабиринта, получает кусочек сахара. У человека вознаграждение может быть материальным, вроде денег, и нематериальным, когда чувствуешь удовольствие от простого «спасибо», сказанного тебе за хорошо выполненную работу. Награда может быть и отложенной, когда делаешь что-то ради того, чтобы достичь определённой цели в более или менее отдалённом будущем.

Некоторые нервные центры, входящие в систему подкрепления. PFC — префронтальная кора, NAc — прилежащее ядро, HIPP — гиппокамп, AMY — амигдала, или миндалевидное тело, VTA — вентральная область покрышки среднего мозга. Нейронные цепочки, по которым они общаются, используют разные нейромедиаторы: ГАМК (гамма-аминомасляная кислота), дофамин, глутамин. Нервные центры, входящие в систему подкрепления, выполняют самые разные задачи: с амигдалой связаны эмоциональные переживания, гиппокамп — один из главных центров памяти, а префронтальная кора играет главную роль в создании сложных когнитивных схем, управляя мыслительной и моторной активностью в соответствии с внутренними целями и планами. Рисунок (с изменениями): GeorgeVKach/Wikimedia Commons, CC BY-SA 4.0.

Но если говорить об обучении, то ведь мы не всегда стремимся к новой информации с целью что-то получить за неё. Часто мы ищем новое знание ради него самого, как если бы оно само было наградой. Нейробиологические исследования это подтверждают: в поисках нужных сведений в мозге активируются центры системы подкрепления, причём активируются как у животных, так и у людей. Несколько лет назад в журнале PNAS была опубликована статья о том, как у людей, играющих в азартную игру, усиливался интерес к информации, которая имела отношение к игре. Даже если она объективно была не слишком ценной, в глазах игроков её ценность начинала расти вместе с потенциальным выигрышем, что сопровождалось повышенной активностью системы подкрепления.

Раз информация может быть более ценной или менее ценной, должен быть нейронный аппарат, который этой ценностью оперирует. Дело не только в ценности одной информации относительно другой, но и в ценности её относительно материальной награды. Недавно в Nature Neuroscience вышла статья* с описанием эксперимента, в котором удалось разделить ценность знания и ценность обычной награды и одновременно увидеть, что происходит в мозге, когда он занимается оценкой того и другого. В эксперименте томящаяся жаждой мышь видела перед собой три отверстия. Первое, что ей надо было сделать, это сунуть нос в центральное отверстие. Там она чуяла один запах, который направлял её к левому отверстию, либо чуяла другой запах, который направлял её к правому отверстию. В правом отверстии мышь попеременно встречали ещё два запаха, при этом один из них говорил о том, что через десять секунд она получит воду, а второй запах сигнализировал, что никакой воды тут не будет вообще. Оба этих «правых» запаха несли конкретное знание: почувствовав их, мышь точно знала, что она либо вскоре получит, либо не получит воду. В левом отверстии также были два запаха, но они никакой информации не несли. Мышь получала или не получала воду вне зависимости от того, какой «левый» запах доносился до её носа**.

Когда мышь выучивала всю схему, в цен-тральном отверстии появлялся третий запах. Если первые два «центральных» запаха однозначно направляли мышь налево или направо, то третий «центральный» запах означал, что она может выбрать, к какому отверстию принюхаться в поисках воды, к левому или к правому. Вероятность получить воду с одной и с другой стороны всякий раз была одинакова. Но про одно отверстие мышь помнила, что там она по запаху может понять, что её ждёт. А про другое отверстие она помнила, что там запахи — это просто запахи. И мышь стабильно предпочитала то отверстие, где запахи несли информацию. Более того, когда в отверстии с информативными запахами уменьшили количество (но не вероятность!) воды, мышь всё равно предпочитала совать нос именно туда. В другом отверстии было больше воды, но запахи там ни о чём не говорили. Получалось так, что мышь ради информации была готова удовольствоваться меньшей наградой (под наградой здесь понимается материальное вознаграждение — вода).

С помощью специального устройства, позволявшего наблюдать активность нескольких сотен нейронов прямо в живом мозге, исследователи описали реакцию орбитофронтальной зоны коры полушарий. С этой зоной работали потому, что она помогает принимать решения — в частности, она оценивает возможные варианты поведения и возможную награду. Когда мышь обоняла информативные запахи, около 20% нейронов орбитофронтальной коры работали иначе, чем когда запахи были неинформативные. Отличия проявлялись тем сильнее, чем дольше у мыши сохранялось знание об информативных запахах. Можно сказать, что знание оказывается наградой в том смысле, что оно уменьшает неопределённость в картине мира, тем самым влияя на мотивацию по-ступков. Хотя стремление к обычной награде и стремление к знанию связаны с системой подкрепления, тем не менее для мозга в целом это разные движущие силы.

В описанных экспериментах знание как бы само мотивировало к тому, чтобы его усвоить. Но тут есть и другие варианты. В 2023 году в Nature вышла статья о том, что у мозга всегда сохраняется шанс что-то запомнить вне зависимости от того, ждёт впереди награда или нет. Возможность эту обеспечивают постоянные колебания нейромедиаторов дофамина и ацетилхолина. Они оба задействованы в мотивационно-обучающих процессах, но их относительный уровень меняется всё время, а не только тогда, когда индивидуум стремится к какой-то цели. В другой работе, опубликованной в прошлом году и тоже в Nature, говорится о том, как бесцельное изучение окружающего мира помогает мозгу лучше справляться с будущими задачами. В проведённых экспериментах некоторым подопытным мышам давали погулять по лабиринту, который они потом должны были более детально изучить за вознаграждение. Мыши, у которых была возможность погулять по лабиринту просто так, справлялись с задачей лучше, чем те, которым погулять по нему не давали. Результат может показаться тривиальным: оказавшись несколько раз на прогулке в каком-нибудь парке, мы запомним, где там что находится, хотя у нас и не было такой цели. Однако в случае с мышами удалось записать отличия в работе мозга, сопутствовавшие бесцельному блужданию и целенаправленному изучению. Эти эксперименты показали, что обучение с целью и обучение без цели, будучи очень схожи друг с другом, происходят в разных нейронных центрах — по крайней мере, если речь идёт об учебной обработке зрительной информации в мозге мыши.

Комментарии к статье

* Bussell J. J., Badman R. P., Márton D. et al. Representations of the intrinsic value of information in mouse orbitofrontal cortex. Nat. Neurosci. 2026, Jul 30.

** «Левыми» и «правыми» запахи названы условно: в ходе эксперимента левое и правое отверстия меняли местами, чтобы удостовериться, что мышь ориентируется именно на запах, а не на пространственное расположение отверстий.

Читайте в любое время

Другие статьи из рубрики «О чём пишут научные журналы мира»

Портал журнала «Наука и жизнь» использует файлы cookie и рекомендательные технологии. Продолжая пользоваться порталом, вы соглашаетесь с хранением и использованием порталом и партнёрскими сайтами файлов cookie и рекомендательных технологий на вашем устройстве. Подробнее