Перейти к содержанию

Селективный блок: как система выбирает траекторию


Место селектора в архитектуре

Прожективный блок построил веер траекторий. Мотивационный блок разметил каждую сигнальными метками. Теперь система стоит перед вопросом: какую траекторию реализовать?

Ответ даёт селективный блок (селектор) — механизм, который получает на вход размеченный веер и выдаёт на выходе выбранную траекторию. Первый шаг этой траектории передаётся исполнительному блоку и превращается в действие.

Селектор — не «генерал», отдающий приказы. Это ранжирующий фильтр: он сравнивает траектории по критериям, заложенным в систему, и пропускает дальше лучшую.


Два режима селектора

Селектор — не тупой максимизатор. У него два принципиально разных режима работы.

Уровень 1: Автоматический (реактивный)

В этом режиме селектор выбирает траекторию, максимизирующую P(T) × V(T) — произведение вероятности на кумулятивную окраску от мотивационной разметки. Быстро, энергоэффективно, эволюционно древне.

Автоматический режим работает в рутинных ситуациях без внутреннего конфликта. Мы идём знакомой дорогой, делаем привычную работу, реагируем на стандартные стимулы. Базальные ганглии, дофаминовый стриатум — этот контур отлажен миллионами лет эволюции.

Уровень 2: Стратегический (волевой)

Когда метапознание регистрирует конфликт — между автоматической разметкой и явными целями из памяти, — селектор переключается в стратегический режим. В этом режиме он не просто берёт готовую окраску. Он сопоставляет траектории с целями трёх горизонтов напрямую:

  • Тактические цели — ближайший шаг, сиюминутный результат
  • Оперативные цели — среднесрочные, на дни и недели
  • Стратегические цели — долгосрочные, ценности, смыслы

Стратегический режим может отклонить максимум автоматической окраски в пользу траектории, ведущей к долгосрочной цели, — даже если её сиюминутная привлекательность ниже. Это и есть воля.

Подробно феномен воли — её проявления, тренировка и патологии — разбираются в главе 03-4. Здесь мы сосредоточимся на архитектуре: как стратегический режим устроен и чем обслуживается.


Три механизма, обслуживающих стратегический режим

Стратегический режим селектора — энергоёмкий и сложный. Он не включается сам по себе. Три механизма обеспечивают его запуск, работу и защиту от срыва обратно в автоматический режим.

1. Метапознание: детектор конфликта

Метапознание (разобранное в главе 03-2) — это контур, который следит за качеством разметки. Когда автоматическая разметка мотивационного блока вступает в конфликт с целями из памяти, метапознание регистрирует этот конфликт и запускает переключение селектора с Уровня 1 на Уровень 2.

«Я хочу ещё кусок торта» — метка ДЕЙСТВОВАТЬ от биологического уровня. «Но я хочу быть в форме» — стратегическая цель из долговременной памяти. Метапознание замечает: автоматическая окраска ведёт к траектории, противоречащей долгосрочной цели. Сигнал: «нужно вмешательство».

Без метапознания стратегический режим не запускается: система не видит конфликта и действует на автопилоте.

2. Переоценка меток: сопоставление с целями

Метапознание запустило стратегический режим. Селектору нужно сопоставить траектории с целями. Но цели из памяти и автоматические метки из мотивационного блока говорят на разных языках. Переоценка меток — механизм, который переводит цели в сигнальные метки, чтобы селектор мог их сравнить.

Биологический уровень поставил ДЕЙСТВОВАТЬ на траекторию «съесть торт». Стратегическая цель «быть в форме» через переоценку ставит ОТКЛОНИТЬСЯ на эту же траекторию — и плюс СТРЕМИТЬСЯ на «не есть торт».

Это не подавление желания, а расширение контекста: траектория получает дополнительные метки от целей, которые автоматическая разметка не учитывает. Воля не говорит «нет» желанию — она говорит «этот путь ведёт не туда, куда я на самом деле хочу».

Переоценка меток энергоёмка: она требует активации префронтальной коры, удержания долгосрочной цели в рабочей памяти, торможения автоматического ответа. Именно поэтому воля устаёт.

3. Исполнительное удержание: защита от срыва

Стратегический режим выбрал траекторию. Но конкурирующие стимулы никуда не делись. Траектория «съесть торт» всё ещё существует в веере, и её автоматическая окраска всё ещё положительна. Автоматический режим селектора (Уровень 1) постоянно «тянет» систему обратно.

Исполнительное удержание — механизм, который активно блокирует переключение селектора обратно в автоматический режим. Это торможение конкурирующих траекторий через дорсолатеральную префронтальную кору и непрямой путь базальных ганглиев.

Без исполнительного удержания стратегический режим нестабилен: система выбрала правильную траекторию, но через минуту скатывается обратно на автоматический максимум.

Три механизма — один режим

Метапознание:       «Вижу конфликт: автоматическая окраска противоречит
                     стратегической цели "быть в форме"»
         ↓
Переоценка меток:   «Сопоставляю траектории с целями из памяти:
                     "торт" получает ОТКЛОНИТЬСЯ,
                     "не есть" получает СТРЕМИТЬСЯ»
         ↓
Исполнительное
удержание:          «Блокирую автоматический режим, удерживаю
                     стратегический выбор, несмотря на соблазн»

Выпадение любого механизма разрушает стратегический режим:

  • Нет метапознания: система не видит конфликта — селектор остаётся в автоматическом режиме.
  • Нет переоценки: система видит конфликт, но не может сопоставить траектории с целями — «знаю, что неправильно, но не могу переопределить».
  • Нет исполнительного удержания: стратегический режим сработал, выбрал правильное, но не может защититься от срыва обратно в автоматический — импульсивность.

Цена стратегического режима: как ограничения влияют на селектор

Архитектура интеллекта работает в четырёх фундаментальных ограничениях: энергия, контекстное окно, время, качество данных (подробно — в главе 02-1). Эти ограничения действуют на всю систему, но стратегический режим страдает от них асимметрично. Автоматический режим выживает почти всегда — он дешёвый и древний. Стратегический отказывает первым.

1. Энергия: самое уязвимое звено

Стратегический режим — префронтально-опосредованный процесс. Префронтальная кора — один из самых энергоёмких регионов мозга. При истощении (голод, недосып, стресс) стратегический режим отключается первым — эволюционно это самая новая и дорогая функция.

Селектор скатывается на Уровень 1. Поведение: импульсивность, срывы, «знаю, что правильно, но сил нет». Субъективно переживается как «слабоволие», хотя это просто энергетический отказ стратегического контура.

Частный случай — стоимость переключения. Переход с автоматического на стратегический режим требует подавления активных автоматических паттернов и активации префронтальных цепей. Это дополнительный расход энергии. Поэтому волевое усилие в момент сильного автоматического импульса (страх, гнев, острое желание) — самое трудное: нужно не только запустить дорогой режим, но и задавить дешёвый.

2. Контекстное окно (W ≤ 4): что удержать одновременно

Стратегический режим требует одновременно удерживать в рабочей памяти:

  • Текущий веер траекторий (минимум 2–3 альтернативы)
  • Цели трёх горизонтов (тактическая → оперативная → стратегическая)
  • Критерии сопоставления
  • Сам факт конфликта между автоматической окраской и стратегической оценкой

Всё это — нагрузка на контекстное окно, ограниченное примерно 4 элементами. Когда целей слишком много или они сложны, стратегический режим схлопывается, не удержав всех элементов. Отсюда практические следствия:

  • Сложные долгосрочные проекты требуют внешних костылей — списков, календарей, напоминалок. Это расширение контекстного окна вовне.
  • Стратегия «один день — одно важное решение» работает именно поэтому: освобождает окно.
  • Медитация и практики осознанности тренируют удержание — расширяют эффективный размер окна.

3. Время: четыре аспекта

Логика обстоятельств (внешнее давление). При времени реакции < 200 мс доступен только Уровень 1. Стратегический режим просто не успевает включиться. Хищник, авария, внезапная угроза — воля отключена по определению. Это не недостаток, а адаптация: когда счёт идёт на миллисекунды, размышление смертельно.

Логика намерений (внутренний резерв). Чтобы запустить стратегический режим, система должна выделить время на рефлексию. Дедлайн, спешка, хронометраж — волевой режим не активируется, даже если энергия есть. Нет паузы — нет воли.

Длительность удержания. Стратегический режим не может работать бесконечно. Волевое усилие истощается со временем — феномен «усталости от решений» (decision fatigue) реален, даже если концепция ego depletion спорна. Это связь времени и энергии: Уровень 2 «сжигает» ресурс и требует восстановления.

Стоимость переключения контекста. Переход с автоматического на стратегический режим — это смена доминирующего контекста. Старые автоматические паттерны «зашумляют» новый. Нужна пауза на стабилизацию.

4. Качество данных: стратегия на ложном фундаменте

Стратегический режим принимает решения на основе сопоставления траекторий с целями из памяти. Если входные данные искажены:

  • Сенсоры дают неверную картину реальности → цели сопоставляются с миражом
  • Память искажает цели (забыл, перепутал приоритеты) → селектор выбирает не ту траекторию
  • В неопределённости система домысливает → стратегический выбор строится на вымысле

Garbage in — garbage out. Стратегический режим не умнее своих данных. Более того: автоматический режим в неопределённости хотя бы опирается на эволюционно отлаженные эвристики — они проверены миллионами лет. Стратегический — на осознанные, но потенциально ошибочные модели. В условиях плохих данных воля может привести к худшему решению, чем автоматизм.

Совокупный эффект: цена волевого усилия

Четыре ограничения не действуют по отдельности — они мультиплицируются. Усталый (энергия ↓) человек в шумной среде (качество данных ↓) с дедлайном (время ↓) не может включить стратегический режим вообще. Селектор остаётся на Уровне 1 — чистый автоматизм.

Это ключевой вывод: стратегический режим селектора — не черта характера, а ресурсозависимая функция, которая может быть временно недоступна по физиологическим причинам.


Нейробиология селектора

Компонент Ключевые структуры Функция
Автоматический режим Базальные ганглии (стриатум), дофаминовый путь Выбор траектории, максимизирующей P(T) × V(T); активация моторной программы
Метапознание (детектор конфликта) Передняя поясная кора, дорсолатеральная префронтальная кора Регистрация расхождения между автоматической окраской и целями из памяти; запуск стратегического режима
Переоценка меток (сопоставление с целями) Вентромедиальная префронтальная кора, орбитофронтальная кора Перевод целей из памяти в сигнальные метки, сопоставимые с автоматической разметкой
Исполнительное удержание (защита от срыва) Дорсолатеральная префронтальная кора, базальные ганглии (непрямой путь) Блокировка переключения селектора обратно в автоматический режим
Энергетическое обеспечение Дофаминовая система (VTA → префронтальная кора) Поддержание способности удерживать стратегический режим

Передняя поясная кора (ППК) играет особую роль: она — детектор конфликта. Когда автоматическая разметка расходится со стратегическими целями, ППК активируется и сигнализирует префронтальной коре: «нужен стратегический режим». Это стартовый сигнал волевого акта.


Селектор в искусственном интеллекте

Что уже есть

Современные системы RLHF имеют зачатки переоценки: reward model корректирует поведение модели вопреки её «естественной» склонности генерировать наиболее вероятное продолжение. Это аналог сопоставления траекторий с целями.

Механизмы constrained decoding и guardrails — аналог исполнительного удержания: они не дают модели выбрать запрещённую траекторию, даже если та имеет высокую автоматическую привлекательность.

Чего не хватает

  1. Собственного метапознания. У модели нет контура, который самостоятельно регистрирует конфликт между краткосрочной и долгосрочной целью. Конфликт всегда задан извне — разработчиком через reward model или системный промпт.

  2. Собственных целей в памяти. Стратегический режим сопоставляет траектории с явными целями, хранящимися в памяти системы. Пока цели заданы извне, это не воля, а следование чужой воле.

  3. Энергетического бюджета. Стратегический режим в биологической системе ограничен метаболизмом. В ИИ нет аналога: модель не «устаёт» от волевых актов. Это может быть как преимуществом (бесконечная воля), так и проблемой: без ограничений воля превращается в бесконечную оптимизацию без возможности остановиться.

Гипотетический модуль стратегического выбора

class StrategicSelector:
    """Стратегический режим селектора: сопоставление траекторий с целями."""

    def __init__(self, metacognition, memory, executive_control):
        self.metacognition = metacognition        # детектор конфликта
        self.memory = memory                      # цели трёх горизонтов
        self.executive_control = executive_control # удержание

    def should_engage(self, trajectory, auto_score):
        """Метапознание: есть ли конфликт между автоматической
        окраской и целями из памяти?"""
        strategic_score = self.memory.evaluate_against_goals(
            trajectory,
            horizons=["tactical", "operational", "strategic"]
        )
        conflict = abs(auto_score - strategic_score)
        return conflict > self.metacognition.threshold

    def select(self, trajectories, auto_scores):
        """Стратегический выбор: сопоставить траектории с целями."""
        best_trajectory = None
        best_strategic_score = -float("inf")

        for t in trajectories:
            score = self.memory.evaluate_against_goals(t)
            if score > best_strategic_score:
                best_strategic_score = score
                best_trajectory = t

        return best_trajectory

    def hold(self, chosen, alternatives):
        """Исполнительное удержание: блокировать автоматический режим."""
        for alt in alternatives:
            self.executive_control.inhibit(alt)
        return chosen

Резюме

  • Селективный блок получает размеченный веер траекторий и выбирает лучшую для исполнения.
  • Два режима: автоматический (max P×V, быстрый и дешёвый) и стратегический (сопоставление с целями из памяти, медленный и дорогой).
  • Три механизма обслуживают стратегический режим: метапознание запускает его, переоценка меток сопоставляет траектории с целями, исполнительное удержание защищает от срыва обратно в автоматический.
  • Ограничения бьют по стратегическому режиму асимметрично: энергия отключает его первой, контекстное окно схлопывается от перегрузки, время в дефиците не даёт включиться, плохие данные делают стратегический выбор хуже автоматического.
  • Стратегический режим — ресурсозависимая функция. Это не черта характера, а архитектурное ограничение.
  • Для ИИ стратегический режим требует собственного метапознания, собственных целей в памяти и, возможно, энергетического бюджета — ничего из этого у текущих систем нет.

Далее: Мотивационный блок: почему мы хотим одного и не хотим другого