Но если говорить об обучении, то ведь мы не всегда стремимся к новой информации с целью что-то получить за неё. Часто мы ищем новое знание ради него самого, как если бы оно само было наградой. Нейробиологические исследования это подтверждают: в поисках нужных сведений в мозге активируются центры системы подкрепления, причём активируются как у животных, так и у людей. Несколько лет назад в журнале PNAS была опубликована статья о том, как у людей, играющих в азартную игру, усиливался интерес к информации, которая имела отношение к игре. Даже если она объективно была не слишком ценной, в глазах игроков её ценность начинала расти вместе с потенциальным выигрышем, что сопровождалось повышенной активностью системы подкрепления.
Раз информация может быть более ценной или менее ценной, должен быть нейронный аппарат, который этой ценностью оперирует. Дело не только в ценности одной информации относительно другой, но и в ценности её относительно материальной награды. Недавно в Nature Neuroscience вышла статья* с описанием эксперимента, в котором удалось разделить ценность знания и ценность обычной награды и одновременно увидеть, что происходит в мозге, когда он занимается оценкой того и другого. В эксперименте томящаяся жаждой мышь видела перед собой три отверстия. Первое, что ей надо было сделать, это сунуть нос в центральное отверстие. Там она чуяла один запах, который направлял её к левому отверстию, либо чуяла другой запах, который направлял её к правому отверстию. В правом отверстии мышь попеременно встречали ещё два запаха, при этом один из них говорил о том, что через десять секунд она получит воду, а второй запах сигнализировал, что никакой воды тут не будет вообще. Оба этих «правых» запаха несли конкретное знание: почувствовав их, мышь точно знала, что она либо вскоре получит, либо не получит воду. В левом отверстии также были два запаха, но они никакой информации не несли. Мышь получала или не получала воду вне зависимости от того, какой «левый» запах доносился до её носа**.
Когда мышь выучивала всю схему, в цен-тральном отверстии появлялся третий запах. Если первые два «центральных» запаха однозначно направляли мышь налево или направо, то третий «центральный» запах означал, что она может выбрать, к какому отверстию принюхаться в поисках воды, к левому или к правому. Вероятность получить воду с одной и с другой стороны всякий раз была одинакова. Но про одно отверстие мышь помнила, что там она по запаху может понять, что её ждёт. А про другое отверстие она помнила, что там запахи — это просто запахи. И мышь стабильно предпочитала то отверстие, где запахи несли информацию. Более того, когда в отверстии с информативными запахами уменьшили количество (но не вероятность!) воды, мышь всё равно предпочитала совать нос именно туда. В другом отверстии было больше воды, но запахи там ни о чём не говорили. Получалось так, что мышь ради информации была готова удовольствоваться меньшей наградой (под наградой здесь понимается материальное вознаграждение — вода).
С помощью специального устройства, позволявшего наблюдать активность нескольких сотен нейронов прямо в живом мозге, исследователи описали реакцию орбитофронтальной зоны коры полушарий. С этой зоной работали потому, что она помогает принимать решения — в частности, она оценивает возможные варианты поведения и возможную награду. Когда мышь обоняла информативные запахи, около 20% нейронов орбитофронтальной коры работали иначе, чем когда запахи были неинформативные. Отличия проявлялись тем сильнее, чем дольше у мыши сохранялось знание об информативных запахах. Можно сказать, что знание оказывается наградой в том смысле, что оно уменьшает неопределённость в картине мира, тем самым влияя на мотивацию по-ступков. Хотя стремление к обычной награде и стремление к знанию связаны с системой подкрепления, тем не менее для мозга в целом это разные движущие силы.
В описанных экспериментах знание как бы само мотивировало к тому, чтобы его усвоить. Но тут есть и другие варианты. В 2023 году в Nature вышла статья о том, что у мозга всегда сохраняется шанс что-то запомнить вне зависимости от того, ждёт впереди награда или нет. Возможность эту обеспечивают постоянные колебания нейромедиаторов дофамина и ацетилхолина. Они оба задействованы в мотивационно-обучающих процессах, но их относительный уровень меняется всё время, а не только тогда, когда индивидуум стремится к какой-то цели. В другой работе, опубликованной в прошлом году и тоже в Nature, говорится о том, как бесцельное изучение окружающего мира помогает мозгу лучше справляться с будущими задачами. В проведённых экспериментах некоторым подопытным мышам давали погулять по лабиринту, который они потом должны были более детально изучить за вознаграждение. Мыши, у которых была возможность погулять по лабиринту просто так, справлялись с задачей лучше, чем те, которым погулять по нему не давали. Результат может показаться тривиальным: оказавшись несколько раз на прогулке в каком-нибудь парке, мы запомним, где там что находится, хотя у нас и не было такой цели. Однако в случае с мышами удалось записать отличия в работе мозга, сопутствовавшие бесцельному блужданию и целенаправленному изучению. Эти эксперименты показали, что обучение с целью и обучение без цели, будучи очень схожи друг с другом, происходят в разных нейронных центрах — по крайней мере, если речь идёт об учебной обработке зрительной информации в мозге мыши.
Комментарии к статье
* Bussell J. J., Badman R. P., Márton D. et al. Representations of the intrinsic value of information in mouse orbitofrontal cortex. Nat. Neurosci. 2026, Jul 30.
** «Левыми» и «правыми» запахи названы условно: в ходе эксперимента левое и правое отверстия меняли местами, чтобы удостовериться, что мышь ориентируется именно на запах, а не на пространственное расположение отверстий.

