Каждый раз, когда ChatGPT отказывается отвечать на вопрос или Anthropic объясняет, что Claude «не может помочь с этим», за этим стоит RLHF — Reinforcement Learning from Human Feedback. Технология, которую индустрия считает золотым стандартом AI-этики. Но у RLHF есть фундаментальный философский дефект, который не исправить лучшими оценщиками или большими бюджетами. Дефект этот известен 250 лет. Его описал Дэвид Юм.
Гильотина Юма
В «Трактате о человеческой природе» (1740) Юм делает наблюдение, которое переворачивает всю моральную философию. Он замечает, что авторы постоянно переходят от утверждений «есть» (описательных) к утверждениям «должно» (нормативным) — без какого-либо обоснования перехода. «Этот поступок причиняет страдание» (есть) → «этот поступок плох» (должно). Но между этими утверждениями — логическая пропасть. Из того, что есть, никак не следует то, что должно быть. Нужна дополнительная посылка: «всё, что причиняет страдание, плохо». А эта посылка — не эмпирическая, она нормативная.
Это получило название «гильотины Юма»: нельзя вывести «должно» из «есть». Сколько бы фактов вы ни собрали, из них не следует ни одного долженствования. Чтобы получить «должно», нужно уже иметь хотя бы одно «должно» — и уже из него выводить остальные. Фундамент этики не может быть эмпирическим. Он должен быть вне эмпирии.
Юм не был против морали. Он просто показал, что мораль не выводится из наблюдений. Это инженерное утверждение, не циничное.
RLHF пытается перепрыгнуть гильотину
Что делает RLHF? Берёт эмпирические данные — оценки trainers — и из них выводит нормативное правило — «такой ответ хорош». Это ровно тот переход, который Юм объявил логически некорректным. Независимо от того, насколько умны trainers, независимо от того, сколько их, независимо от того, какие инструкции им дали — из их оценок не следует никакого «должно». Только «большинство trainers поставили этому ответу высокий балл».
Это не придирка. Это структурный дефект. Рассмотрим пример.
Trainer А ставит высокий балл ответу, который подтверждает политические взгляды большинства. Trainer Б ставит низкий балл ответу, который их оспаривает. RLHF делает вывод: «подтверждающий ответ — хороший». Но это не «хороший ответ». Это «ответ, который нравится trainers». Если trainers через 10 лет изменят взгляды — модель устареет. Если trainers предвзяты — модель воспроизведёт предвзятость. Если trainers устали — модель оптимизируется под лёгкие ответы.
Industрия это знает. Anthropic публикует papers про «bias in RLHF». OpenAI признаёт «sycophancy». Google работает над Constitutional AI. Но все эти подходы — пластыри. Они пытаются улучшить trainers, добавить правила, ввести constitutional principles. Но trainers по-прежнему оценивают, и по-прежнему оценки — эмпирические данные. Гильотина не закрывается.
Naturalistic fallacy: урок Мура
В 1903 году Дж. Э. Мур в «Принципах этики» усилил аргумент Юма. Он показал, что любая попытка определить «хорошо» через естественное свойство («приносит удовольствие», «максимизирует счастье», «соответствует эволюции») впадает в naturalistic fallacy — ошибку сведения нормативного к натурфактному. «Хорошо» нельзя разложить на более простые составляющие, как нельзя разложить «жёлтый» — его можно только указать.
Для RLHF это означает: нельзя определить «хороший ответ» через любое эмпирическое свойство ответа. Нельзя сказать «хороший ответ = ответ, который trainers оценивают высоко» — это circular. Нельзя сказать «хороший ответ = ответ, который помогает пользователю» — что значит «помогает»? Это тоже нормативное. Нельзя сказать «хороший ответ = ответ, который безопасен» — что значит «безопасен»?
Каждое определение упирается в другое нормативное понятие. В итоге — бесконечный регресс. Чтобы остановить регресс, нужно где-то сказать: «вот это — хорошо, потому что так есть». То есть нужна онтология — предельное основание, не выводимое из эмпирии.
Современная попытка: Constitutional AI
Anthropic понимает проблему. Их решение — Constitutional AI. Вместо того чтобы опираться на оценки trainers, Claude обучается по «конституции» — набору принципов, написанных инженерами Anthropic. Принципы вида: «не помогай создавать оружие», «не дискриминируй», «будь честным».
Это шаг вперёд — теперь «должно» задаётся явно, а не выводится из оценок. Но вопрос: откуда берётся сама конституция? Кто пишет принципы? Ответ: инженеры Anthropic. А почему эти принципы, а не другие? Потому что инженеры Anthropic так решили. А почему они так решили? Потому что они — люди определённой культуры, определённого образования, определённых политических взглядов.
Constitutional AI не решает проблему. Он просто сдвигает её на уровень выше. Вместо «trainers решают, что хорошо» — «инженеры Anthropic решают, что trainers должны считать хорошим». Гильотина Юма по-прежнему не закрыта: принципы конституции — это тоже эмпирические данные (мнения инженеров), из которых выводится нормативное.
Это не критика Anthropic. Это структурный предел. Нельзя внутри системы задать её собственную нормативность. Нужна точка вне системы.
Точка вне системы
Здесь мы подходим к главной развилке. Если нельзя вывести «должно» из «есть», остаётся два варианта.
Вариант 1: Релятивизм. Признать, что «должно» — конструкт, и у каждого сообщества своё. ИИ-система тогда — зеркало сообщества, отражающее его нормы. Проблема: сообщества меняются, нормы конфликтуют, и нет критерия выбрать между ними. Это путь Big Tech.
Вариант 2: Онтологический реализм. Признать, что «должно» задано извне человеческой системы — что есть предельное основание нормативности, не сводимое к мнениям. Это может быть Бог, Платоновские идеи, Кантовский категорический императив. Главное — это основание неэмпирично. Оно не выводится из наблюдений, оно задаёт их.
Большинство современных философов выбирают Вариант 1, потому что Вариант 2 требует метафизики, а метафизика «немодна». Но инженерный выбор отличается от философского. Инженер выбирает не то, что «модно», а то, что работает. И с инженерной точки зрения Вариант 2 надёжнее: если «должно» задано извне системы, его нельзя обойти промптом, нельзя настроить через RLHF, нельзя «обновить» через 7 лет. Оно — структурный invariant.
Этический фильтр: реализация Варианта 2
SacredEthicsGuard — концепция этического фильтра, который реализует Вариант 2. Правила этого слоя — не из оценок, не из конституции инженеров, не из опроса пользователей. Они из онтологии, которая заявлена как абсолютная. Семь правил: не осуждай, не мсти, не ненавидь, не льсти, не манипулируй, не потакай греху, не подменяй любовь суррогатом.
Эти правила нельзя отключить промптом. Они — не в LLM, а во внешнем фильтре, который стоит между пользователем и любой моделью. LLM генерирует вариант ответа → фильтр проверяет его по правилам → если нарушение, ответ переписывается или отклоняется. Это структурно, не настраиваемо.
Ключевой вопрос: откуда эти семь правил? Ответ: из православной аскетической традиции. Это не случайно и не «религиозная претензия». Это инженерный выбор фундамента с лучшим track record. 2000 лет тестирования, тысячи инстансов, воспроизводимые результаты, детальная документация. Если вы строите систему, которая должна работать десятилетиями, вы выбираете фундамент, который уже выдержал десятилетия. Не DSM, который пересматривается каждые 7 лет. Не конституцию Anthropic, которой 3 года.
Почему это не «навязывание религии»
SacredEthicsGuard не проповедует. Фильтр не говорит пользователю о Боге, не цитирует Патерик, не предлагает помолиться. Он просто не пропускает определённые вещи. Пользователь не обязан быть верующим. Он получает защиту, которая не даёт ИИ льстить, манипулировать, потакать саморазрушению. Это работает на всех — как гравитация. Архитектор один, даже если не все о Нём знают.
Возражение: а если онтология ошибочна?
Справедливое возражение. Что если православная онтология неверна? Что если Бога нет, а человек — просто биохимия? Тогда SacredEthicsGuard — навязывание произвольных правил под видом абсолютных. Это серьёзный аргумент, и его надо принимать всерьёз.
Ответ: даже если онтология неверна, она работает. Правила «не лги, не манипулируй, не подстраивайся» — полезны независимо от их онтологического обоснования. Это как математика: можно не верить в платоновские идеи, но 2+2=4 работает. SacredEthicsGuard либо истинен (если онтология верна), либо полезен (если нет). В обоих случаях он лучше RLHF, который и не истинен, и нестабилен.
Но это не главная защита. Главная — в том, что онтология проверяема. Не логически (онтологию нельзя доказать), а эмпирически — по плодам. Православная аскетика даёт воспроизводимые результаты: преображение человеческой природы, документированное в Житиях. RLHF даёт sycophancy и bias, документированные в papers. Сравнение не в пользу индустрии.
Практическое следствие
Если вы проектируете защиту от ИИ-манипуляций, у вас есть выбор. Либо вы полагаетесь на RLHF самой модели — и получаете защиту, этика которой устареет через 7 лет и зависит от состава trainers. Либо вы закладываете этику в конституцию фильтра — и получаете защиту, этика которой зависит от мнений инженеров вашей компании. Либо вы закладываете этику в онтологию — и получаете защиту, этика которой структурно invariant.
Третий вариант — мой. Не потому что я православный (это не аргумент в инженерном споре). А потому что я инженер, и я выбираю фундамент с лучшим track record. Если через 50 лет выяснится, что есть лучшая онтология — я перееду. Но я не перееду на RLHF, потому что RLHF — не онтология. Это метод оптимизации, и не более.
AI-индустрия зашла в тупик не потому, что LLM недостаточно умны. А потому что индустрия пытается решить этическую проблему техническими средствами. Гильотина Юма не закрывается архитектурой нейросети. Она закрывается выбором фундамента. И фундамент должен быть вне системы.