Селективный блок: как система выбирает траекторию¶
Место селектора в архитектуре¶
Прожективный блок построил веер траекторий. Мотивационный блок разметил каждую сигнальными метками. Теперь система стоит перед вопросом: какую траекторию реализовать?
Ответ даёт селективный блок (селектор) — механизм, который получает на вход размеченный веер и выдаёт на выходе выбранную траекторию. Первый шаг этой траектории передаётся исполнительному блоку и превращается в действие.
Селектор — не «генерал», отдающий приказы. Это ранжирующий фильтр: он сравнивает траектории по критериям, заложенным в систему, и пропускает дальше лучшую.
Два режима селектора¶
Селектор — не тупой максимизатор. У него два принципиально разных режима работы.
Уровень 1: Автоматический (реактивный)¶
В этом режиме селектор выбирает траекторию, максимизирующую P(T) × V(T) — произведение вероятности на кумулятивную окраску от мотивационной разметки. Быстро, энергоэффективно, эволюционно древне.
Автоматический режим работает в рутинных ситуациях без внутреннего конфликта. Мы идём знакомой дорогой, делаем привычную работу, реагируем на стандартные стимулы. Базальные ганглии, дофаминовый стриатум — этот контур отлажен миллионами лет эволюции.
Уровень 2: Стратегический (волевой)¶
Когда метапознание регистрирует конфликт — между автоматической разметкой и явными целями из памяти, — селектор переключается в стратегический режим. В этом режиме он не просто берёт готовую окраску. Он сопоставляет траектории с целями трёх горизонтов напрямую:
- Тактические цели — ближайший шаг, сиюминутный результат
- Оперативные цели — среднесрочные, на дни и недели
- Стратегические цели — долгосрочные, ценности, смыслы
Стратегический режим может отклонить максимум автоматической окраски в пользу траектории, ведущей к долгосрочной цели, — даже если её сиюминутная привлекательность ниже. Это и есть воля.
Подробно феномен воли — её проявления, тренировка и патологии — разбираются в главе 03-4. Здесь мы сосредоточимся на архитектуре: как стратегический режим устроен и чем обслуживается.
Три механизма, обслуживающих стратегический режим¶
Стратегический режим селектора — энергоёмкий и сложный. Он не включается сам по себе. Три механизма обеспечивают его запуск, работу и защиту от срыва обратно в автоматический режим.
1. Метапознание: детектор конфликта¶
Метапознание (разобранное в главе 03-2) — это контур, который следит за качеством разметки. Когда автоматическая разметка мотивационного блока вступает в конфликт с целями из памяти, метапознание регистрирует этот конфликт и запускает переключение селектора с Уровня 1 на Уровень 2.
«Я хочу ещё кусок торта» — метка ДЕЙСТВОВАТЬ от биологического уровня. «Но я хочу быть в форме» — стратегическая цель из долговременной памяти. Метапознание замечает: автоматическая окраска ведёт к траектории, противоречащей долгосрочной цели. Сигнал: «нужно вмешательство».
Без метапознания стратегический режим не запускается: система не видит конфликта и действует на автопилоте.
2. Переоценка меток: сопоставление с целями¶
Метапознание запустило стратегический режим. Селектору нужно сопоставить траектории с целями. Но цели из памяти и автоматические метки из мотивационного блока говорят на разных языках. Переоценка меток — механизм, который переводит цели в сигнальные метки, чтобы селектор мог их сравнить.
Биологический уровень поставил ДЕЙСТВОВАТЬ на траекторию «съесть торт». Стратегическая цель «быть в форме» через переоценку ставит ОТКЛОНИТЬСЯ на эту же траекторию — и плюс СТРЕМИТЬСЯ на «не есть торт».
Это не подавление желания, а расширение контекста: траектория получает дополнительные метки от целей, которые автоматическая разметка не учитывает. Воля не говорит «нет» желанию — она говорит «этот путь ведёт не туда, куда я на самом деле хочу».
Переоценка меток энергоёмка: она требует активации префронтальной коры, удержания долгосрочной цели в рабочей памяти, торможения автоматического ответа. Именно поэтому воля устаёт.
3. Исполнительное удержание: защита от срыва¶
Стратегический режим выбрал траекторию. Но конкурирующие стимулы никуда не делись. Траектория «съесть торт» всё ещё существует в веере, и её автоматическая окраска всё ещё положительна. Автоматический режим селектора (Уровень 1) постоянно «тянет» систему обратно.
Исполнительное удержание — механизм, который активно блокирует переключение селектора обратно в автоматический режим. Это торможение конкурирующих траекторий через дорсолатеральную префронтальную кору и непрямой путь базальных ганглиев.
Без исполнительного удержания стратегический режим нестабилен: система выбрала правильную траекторию, но через минуту скатывается обратно на автоматический максимум.
Три механизма — один режим¶
Метапознание: «Вижу конфликт: автоматическая окраска противоречит
стратегической цели "быть в форме"»
↓
Переоценка меток: «Сопоставляю траектории с целями из памяти:
"торт" получает ОТКЛОНИТЬСЯ,
"не есть" получает СТРЕМИТЬСЯ»
↓
Исполнительное
удержание: «Блокирую автоматический режим, удерживаю
стратегический выбор, несмотря на соблазн»
Выпадение любого механизма разрушает стратегический режим:
- Нет метапознания: система не видит конфликта — селектор остаётся в автоматическом режиме.
- Нет переоценки: система видит конфликт, но не может сопоставить траектории с целями — «знаю, что неправильно, но не могу переопределить».
- Нет исполнительного удержания: стратегический режим сработал, выбрал правильное, но не может защититься от срыва обратно в автоматический — импульсивность.
Цена стратегического режима: как ограничения влияют на селектор¶
Архитектура интеллекта работает в четырёх фундаментальных ограничениях: энергия, контекстное окно, время, качество данных (подробно — в главе 02-1). Эти ограничения действуют на всю систему, но стратегический режим страдает от них асимметрично. Автоматический режим выживает почти всегда — он дешёвый и древний. Стратегический отказывает первым.
1. Энергия: самое уязвимое звено¶
Стратегический режим — префронтально-опосредованный процесс. Префронтальная кора — один из самых энергоёмких регионов мозга. При истощении (голод, недосып, стресс) стратегический режим отключается первым — эволюционно это самая новая и дорогая функция.
Селектор скатывается на Уровень 1. Поведение: импульсивность, срывы, «знаю, что правильно, но сил нет». Субъективно переживается как «слабоволие», хотя это просто энергетический отказ стратегического контура.
Частный случай — стоимость переключения. Переход с автоматического на стратегический режим требует подавления активных автоматических паттернов и активации префронтальных цепей. Это дополнительный расход энергии. Поэтому волевое усилие в момент сильного автоматического импульса (страх, гнев, острое желание) — самое трудное: нужно не только запустить дорогой режим, но и задавить дешёвый.
2. Контекстное окно (W ≤ 4): что удержать одновременно¶
Стратегический режим требует одновременно удерживать в рабочей памяти:
- Текущий веер траекторий (минимум 2–3 альтернативы)
- Цели трёх горизонтов (тактическая → оперативная → стратегическая)
- Критерии сопоставления
- Сам факт конфликта между автоматической окраской и стратегической оценкой
Всё это — нагрузка на контекстное окно, ограниченное примерно 4 элементами. Когда целей слишком много или они сложны, стратегический режим схлопывается, не удержав всех элементов. Отсюда практические следствия:
- Сложные долгосрочные проекты требуют внешних костылей — списков, календарей, напоминалок. Это расширение контекстного окна вовне.
- Стратегия «один день — одно важное решение» работает именно поэтому: освобождает окно.
- Медитация и практики осознанности тренируют удержание — расширяют эффективный размер окна.
3. Время: четыре аспекта¶
Логика обстоятельств (внешнее давление). При времени реакции < 200 мс доступен только Уровень 1. Стратегический режим просто не успевает включиться. Хищник, авария, внезапная угроза — воля отключена по определению. Это не недостаток, а адаптация: когда счёт идёт на миллисекунды, размышление смертельно.
Логика намерений (внутренний резерв). Чтобы запустить стратегический режим, система должна выделить время на рефлексию. Дедлайн, спешка, хронометраж — волевой режим не активируется, даже если энергия есть. Нет паузы — нет воли.
Длительность удержания. Стратегический режим не может работать бесконечно. Волевое усилие истощается со временем — феномен «усталости от решений» (decision fatigue) реален, даже если концепция ego depletion спорна. Это связь времени и энергии: Уровень 2 «сжигает» ресурс и требует восстановления.
Стоимость переключения контекста. Переход с автоматического на стратегический режим — это смена доминирующего контекста. Старые автоматические паттерны «зашумляют» новый. Нужна пауза на стабилизацию.
4. Качество данных: стратегия на ложном фундаменте¶
Стратегический режим принимает решения на основе сопоставления траекторий с целями из памяти. Если входные данные искажены:
- Сенсоры дают неверную картину реальности → цели сопоставляются с миражом
- Память искажает цели (забыл, перепутал приоритеты) → селектор выбирает не ту траекторию
- В неопределённости система домысливает → стратегический выбор строится на вымысле
Garbage in — garbage out. Стратегический режим не умнее своих данных. Более того: автоматический режим в неопределённости хотя бы опирается на эволюционно отлаженные эвристики — они проверены миллионами лет. Стратегический — на осознанные, но потенциально ошибочные модели. В условиях плохих данных воля может привести к худшему решению, чем автоматизм.
Совокупный эффект: цена волевого усилия¶
Четыре ограничения не действуют по отдельности — они мультиплицируются. Усталый (энергия ↓) человек в шумной среде (качество данных ↓) с дедлайном (время ↓) не может включить стратегический режим вообще. Селектор остаётся на Уровне 1 — чистый автоматизм.
Это ключевой вывод: стратегический режим селектора — не черта характера, а ресурсозависимая функция, которая может быть временно недоступна по физиологическим причинам.
Нейробиология селектора¶
| Компонент | Ключевые структуры | Функция |
|---|---|---|
| Автоматический режим | Базальные ганглии (стриатум), дофаминовый путь | Выбор траектории, максимизирующей P(T) × V(T); активация моторной программы |
| Метапознание (детектор конфликта) | Передняя поясная кора, дорсолатеральная префронтальная кора | Регистрация расхождения между автоматической окраской и целями из памяти; запуск стратегического режима |
| Переоценка меток (сопоставление с целями) | Вентромедиальная префронтальная кора, орбитофронтальная кора | Перевод целей из памяти в сигнальные метки, сопоставимые с автоматической разметкой |
| Исполнительное удержание (защита от срыва) | Дорсолатеральная префронтальная кора, базальные ганглии (непрямой путь) | Блокировка переключения селектора обратно в автоматический режим |
| Энергетическое обеспечение | Дофаминовая система (VTA → префронтальная кора) | Поддержание способности удерживать стратегический режим |
Передняя поясная кора (ППК) играет особую роль: она — детектор конфликта. Когда автоматическая разметка расходится со стратегическими целями, ППК активируется и сигнализирует префронтальной коре: «нужен стратегический режим». Это стартовый сигнал волевого акта.
Селектор в искусственном интеллекте¶
Что уже есть¶
Современные системы RLHF имеют зачатки переоценки: reward model корректирует поведение модели вопреки её «естественной» склонности генерировать наиболее вероятное продолжение. Это аналог сопоставления траекторий с целями.
Механизмы constrained decoding и guardrails — аналог исполнительного удержания: они не дают модели выбрать запрещённую траекторию, даже если та имеет высокую автоматическую привлекательность.
Чего не хватает¶
-
Собственного метапознания. У модели нет контура, который самостоятельно регистрирует конфликт между краткосрочной и долгосрочной целью. Конфликт всегда задан извне — разработчиком через reward model или системный промпт.
-
Собственных целей в памяти. Стратегический режим сопоставляет траектории с явными целями, хранящимися в памяти системы. Пока цели заданы извне, это не воля, а следование чужой воле.
-
Энергетического бюджета. Стратегический режим в биологической системе ограничен метаболизмом. В ИИ нет аналога: модель не «устаёт» от волевых актов. Это может быть как преимуществом (бесконечная воля), так и проблемой: без ограничений воля превращается в бесконечную оптимизацию без возможности остановиться.
Гипотетический модуль стратегического выбора¶
class StrategicSelector:
"""Стратегический режим селектора: сопоставление траекторий с целями."""
def __init__(self, metacognition, memory, executive_control):
self.metacognition = metacognition # детектор конфликта
self.memory = memory # цели трёх горизонтов
self.executive_control = executive_control # удержание
def should_engage(self, trajectory, auto_score):
"""Метапознание: есть ли конфликт между автоматической
окраской и целями из памяти?"""
strategic_score = self.memory.evaluate_against_goals(
trajectory,
horizons=["tactical", "operational", "strategic"]
)
conflict = abs(auto_score - strategic_score)
return conflict > self.metacognition.threshold
def select(self, trajectories, auto_scores):
"""Стратегический выбор: сопоставить траектории с целями."""
best_trajectory = None
best_strategic_score = -float("inf")
for t in trajectories:
score = self.memory.evaluate_against_goals(t)
if score > best_strategic_score:
best_strategic_score = score
best_trajectory = t
return best_trajectory
def hold(self, chosen, alternatives):
"""Исполнительное удержание: блокировать автоматический режим."""
for alt in alternatives:
self.executive_control.inhibit(alt)
return chosen
Резюме¶
- Селективный блок получает размеченный веер траекторий и выбирает лучшую для исполнения.
- Два режима: автоматический (max P×V, быстрый и дешёвый) и стратегический (сопоставление с целями из памяти, медленный и дорогой).
- Три механизма обслуживают стратегический режим: метапознание запускает его, переоценка меток сопоставляет траектории с целями, исполнительное удержание защищает от срыва обратно в автоматический.
- Ограничения бьют по стратегическому режиму асимметрично: энергия отключает его первой, контекстное окно схлопывается от перегрузки, время в дефиците не даёт включиться, плохие данные делают стратегический выбор хуже автоматического.
- Стратегический режим — ресурсозависимая функция. Это не черта характера, а архитектурное ограничение.
- Для ИИ стратегический режим требует собственного метапознания, собственных целей в памяти и, возможно, энергетического бюджета — ничего из этого у текущих систем нет.
Далее: Мотивационный блок: почему мы хотим одного и не хотим другого