Представим себе амбициозного Сашу, который, чтобы повысить свою значимость у друга по соцсетям Гриши, предлагает ему играть в шахматы. Саша едва знает как ходят фигуры и надеется на подсказки chatGPT, Гриша же давно освоился и играет хорошо. И все получается у Саши. Гриша начинает его уважать, открывая новую приятную особенность друга. До тех пор как вдруг Саша диктует очередной ход прямо сквозь стоящего коня (лошади, как смешно называет фигуру Саша).
- Ни чо се, - пишет Гриша другану, - ты прошел сквозь мою лошадь!
- Ой, сорри, щас, - и Саша исправно переигрывает. Ну как же это клево, отхлебывая пивка у компа соцсетевыми приколами, изредка, небрежно отправлять другану новый ход.
Смутное подозрение толкает Гришу на предложение.
- Санек, чет надоели обычные шахматы, давай сыграем в модные семь по горизонтали, без ферзя?
- Давай, базару нет!
Они заклеивают ферзевую (королевину) вертикаль на своих досках черным скотчем, и Гриша делает первый ход. Саша, конечно же, уже прописал промпт новых правил своему Дипсику и диктует ему первых ход Гриши: е2-е4. Саша усмехается и отвечает: d7-d5,
- Алло, Сашок, d у нас нет, она черно-скотчевая.
- Блин… хрень какая…
Намного подергавшись с паникующим Дипсихом, Саша честно признался, что решил вот так поумничать.
Что произошло? У GPT для новых правил нет оказалось никакого обучения, а статистика для нормальных правил выдает или глюки или что-то несуразное – начинается игра с совершенно не способным обучаться на лету младенцем. Человек довольно быстро начнет осваиваться в новых правилах, а GPT – нет, он так и остается на том же самом уровне. При отсутствии статистики последовательностей, которая формируется при обучении, GPT начинает галлюцинировать,
Механизм галлюцинаций в такой ситуации — это прямое следствие того, как устроена математика архитектуры Transformer (основы всех моделей GPT). Когда у ИИ нет точной статистики последовательностей (как в случае с доской 7х8 без ферзя), модель не может просто сказать: «Я не знаю правил». Архитектура заставляет её генерировать следующий токен в любом случае. У этой архитектуры математически отсутствует кнопка «стоп» или функция «я не знаю».
В основе работы GPT лежит одно фундаментальное правило: следующий элемент выбирается по максимуму статистической вероятности на основе того, как текущая (уже оформленная) последовательность завершалась в обучающих данных.
Модель выбирает абсолютный максимум — d7-d5 — и выдает его. Ей плевать, что на усеченной доске из-за смещения координат этот ход может быть позиционно абсурдным или физически невозможным. На основе обученной статистики последовательностей текста символ d5 — это математический пик вероятности после последовательности e2 - e4. У GPT просто нет способа определить, что такое правило последовательностей уже не должно применяться, потому что не было соответствующего обучения, в контексте измененных правил игры.
Но если бы модель обучалась игре в шахматы по правила без вертикали d, то статистика последовательностей бралась в нужном контексте.
Таким образом, в статистике выбора G{T играют роль не только последовательности диалога, но и последовательности предваряющего правила промпта – как наиболее общий контекст.
Главный механизм реализации статистики
В аббревиатуре GRT символ T означает сакраментальное слово “трансформер”. В самой простой и понятной интерпретации: Трансформер — это математический механизм идеального контекста. Его главный механизм — это мгновенное перемножение гигантских таблиц с числами, где для каждого слова заранее просчитана математическая сила связи со всеми остальными словами в тексте.
Когда вы отправляете Трансформеру текст, происходит чисто механический процесс:
- Слова превращаются в координаты (Эмбеддинги). Каждое слово из партии Саши и Гриши компьютер заменяет на длинный список чисел (например, вектор из 4096 цифр). В этих числах зашито, в каком текстовом окружении это слово обычно встречается в интернете.
- Из этих списков чисел компьютер собирает огромную сетку (матрицу), похожую на таблицу расстояний между городами на карте. Только вместо городов там слова из вашего запроса, а вместо километров — коэффициенты значимости.
- Архитектура Трансформера устроена так, что процессор видеокарты за один такт работы (одновременно, а не по очереди) перемножает эти строки и столбцы.
На пересечении строки со словом e2-e4 и столбца со словом d7-d5 получается самое большое число.
Для видеокарты это просто математический пик, сигнал максимального напряжения. Робот не «понимает» связь между ходами — он просто выполнил миллион сложений и умножений, и на выходе из этой мясорубки чисел формула выдала код символа d5 как самый числовой весомый результат.
Таким образом, «видеть контекст» для Трансформера означает «одновременно перемножить математические веса всех элементов строки друг на друга». Галлюцинация происходит потому, что в этой таблице умножения веса старых шахматных ходов физически перевешивают и стирают веса новых правил.
Изобрести такой механизм, поверить в него так, чтобы в долгих попытках отладить и оптимизировать выбор статистики обучения – это настоящее открытие принципа, позволившего достичь наблюдаемой эффективности результатом GPT, но при этом принципиально обладающего свойствами галлюцинировать при отсутствии нужной статистики в последовательности в данном контексте.
Трансформер — это не «думающая машина». Это гигантский матричный умножитель, который за один такт (параллельно, а не последовательно) перемножает:
- Матрицу запросов (Q) — то, что вы спрашиваете
- Матрицу ключей (K) — то, что модель «знает» о всех словах в своей памяти
- Матрицу значений (V) — то, какие ответы закреплены за этими ключами
На выходе — скалярное произведение, число, которое показывает силу статистической связи между текущим контекстом и каждым возможным следующим словом.
Галлюцинация в LLM — не сбой, а математическая неизбежность, заложенная в архитектуру Transformer. На последнем слое модели функция softmax распределяет вероятности по всему словарю с суммой, равной единице. Модель не может выбрать «не знаю» — она обязана выбрать максимум. Когда в новой игре закрывают вертикаль d, контекстный промпт с этим правилом становится частью локального внимания, но глобальные веса модели, зафиксированные на миллиардах примеров нормальных шахмат, имеют колоссальную статистическую массу. Они физически перевешивают локальный контекст, и модель выдаёт d7-d5 — не потому что «считает этот ход правильным», а потому что в матрице умножения это число оказалось самым большим. У LLM нет механизма дедукции, нет способа пересобрать модель мира под новую аксиому. Она не понимает правила — она запоминает, какие последовательности токенов статистически сопряжены. Трансформер — это идеальный контекстный калькулятор, но калькулятор не знает, что такое «смысл». Он знает только, что после e2-e4 чаще всего идёт d7-d5. И он выдаст этот ход даже тогда, когда поле d7 заклеено чёрным скотчем.
LLM — это библиотекарь, который знает все книги наизусть. Если вы спросите его, что делать, когда в шахматах убрали ферзя, он процитирует вам главу из учебника, где ферзь есть. Он не может сказать: «Я не знаю, что делать без ферзя, давайте подумаем вместе». Он обязан дать ответ. И он даст ответ из книг, которые знает, даже если этот ответ неуместен. Он — идеальный памятник человеческому тексту, но он не человек. И в этом его сила и его проклятие.
В виде чего и как хранится статистика при обучении LLM
Статистика представлена в виде распознавателей результата в сети многослойного персептрона. Когда текущая последовательность вызывает распознавание, что в таком случае результат такой-то.
Статистика в LLM хранится не в виде базы данных партий, не в виде текстовых файлов и не в виде явных правил «если-то». Она хранится исключительно внутри гигантских матриц чисел, которые физически представляют собой веса связей в многослойных сетях. Когда мы говорили про механизм Трансформера, то могло создаться впечатление об алгоритмическом процессе сложнейших вычислений.
Вся выученная статистика — это сотни миллиардов дробных чисел (например, 0.0074, -0.1245), называемых весами параметров (weights).
Если сильно упростить, Трансформер состоит из двух главных блоков, которые чередуются друг за другом десятки раз:
- Блок Внимания (Attention): это динамический калькулятор, который измеряет связи между словами внутри вашего текущего запроса.
- Блок MLP (Multi-Layer Perceptron / Многослойный перцептрон): это как раз те самые классические слои нейросети («распознаватели»), о которых вы говорите.
Когда ИИ обучается на миллиардах шахматных партий, эти числа-веса внутри MLP и Attention микроскопически меняются. В итоге статистика кодируется в геометрию связей: если какая-то последовательность (например, 1. e4 e5 2. Nf3) встречалась миллионы раз, то в сети протаптывается мощнейшая математическая «магистраль». Веса настраиваются так, чтобы проводить этот сигнал с минимальным сопротивлением.
Как текущая последовательность вызывает распознавание?
Когда Саша вводит в поле запроса текст партии, запускается процесс, который в ИИ-инженерии называется прямым проходом (Forward Pass). Это чисто механическая активация «распознавателей»:
- Векторный отпечаток: Текст Саши превращается в набор чисел (векторов) и подается на вход первого слоя.
- Каскад распознавания (Слой за слоем): Сигнал идет сквозь слои персептрона. Каждый слой работает как иерархический распознаватель образов:
- Низшие слои распознают простые паттерны: буквы, цифры, отдельные токены (например, символ e4).
- Средние слои распознают контекстуальные шаблоны: они «понимают», что 1. e4 — это начало дебюта, а не случайный набор знаков.
- Высшие слои активируют самые сложные абстрактные структуры. Они «видят» весь совокупный образ: «Перед нами текст шахматной партии, где белые сыграли e4, а черные ответили e5».
- Резонанс (Активация): Текущая последовательность ходов действует как ключ к замку. Она вызывает лавинообразное возбуждение (высокие значения активации) именно в тех участках многослойной сети, которые «заточены» под шахматную статистику. Сеть входит в состояние математического резонанса с этим конкретным шаблоном.
Что является результатом распознавания?
Результатом этого каскада распознавания является не готовое слово, а прогноз на будущее.
Когда сигнал доходит до самого последнего слоя нейросети, этот слой выдает так называемые логиты (logits). Это сырые числовые оценки для каждого возможного символа из словаря ИИ.
- Перцептрон как бы говорит: «На основе того паттерна, который во мне сейчас срезонировал, символ N (Конь) имеет силу сигнала +15.2, символ B (Слон) — +9.1, а символ X — -12.4».
- Затем финальная функция (Softmax) переводит эти силы сигналов в понятные проценты вероятности: Nf3 — 80%, Nc3 — 15%, и так далее.
Почему это ломается на доске 7х8? (Механика сбоя)
Теперь, зная этот механизм, мы можем абсолютно точно описать, что происходит, когда Саша предлагает боту измененные правила:
- Саша вводит промпт: «Доска 7х8, ферзей нет, ход 1. e4».
- Сигнал идет по слоям перцептрона. Фраза «Доска 7х8, ферзей нет» активирует слабые, размытые участки сети (так как такой статистики почти нет).
- Но как только сигнал доходит до токена 1. e4, внутри перцептрона вспыхивает колоссальный, накопленный миллиардами партий шахматный шаблон. Этот древний паттерн обычной игры 8х8 настолько мощный, что его электрический (математический) сигнал просто выжигает и глушит слабый сигнал от фразы про новые правила.
- Высшие слои-распознаватели рапортуют: «Я зафиксировал стандартный шахматный дебют!».
- Последний слой послушно выдает максимальный уровень активации для хода e5 или Nf3, потому что именно к этому результату приучен данный распознаватель.
Сеть выдает ход для стандартных шахмат не потому, что она «глупая», а потому, что Сашин запрос активировал внутри её многослойного перцептрона гигантский, монолитный статистический триггер, сдвинуть который короткой текстовой припиской в промпте математически невозможно.
Особенности многослойных персептронов
Есть совершенно безальтернативные плюсы к многослойной организации персептронов, но есть и очень серьезно тормозящие прогресс минусы.
Скорость и ресурсы
Они максимально быстро распознают результат в зависимости от состояния на входах. Просто нет ничего быстрее и без персептронной техники осуществить статистические вычисления с тем же эффектом просто невозможно.
В многослойном перцептроне время поиска математически константно — O(1).
Сигнал от Сашиного запроса заходит на входные слои и просто «падает» сквозь матричную структуру сети до самого выхода. Ему не нужно нигде останавливаться, сравнивать или сомневаться. Сеть не «ищет» ответ в памяти — ответ формируется мгновенно в процессе прохождения сигнала через веса. Никакая другая вычислительная архитектура в мире не способна выдать статистический результат такой сложности с такой скоростью.
Структура MLP идеально легла на архитектуру современных видеокарт. Компьютер обрабатывает всю сложную «текущую последовательность» не по буквам, а единым махом, задействуя миллиарды транзисторов в одну миллисекунду. Без перцептронов осуществить статистические вычисления такого масштаба в реальном времени было бы физически невозможно — суперкомпьютеры бы просто расплавились от перегрузки.
Очень капризное обучение
Взамен такой эффективности они требуют колоссальных затрат на обучение, так чтобы данные на входе точно начали соответствовать получаемым результатам. Процесс обучения современных больших моделей (LLM) — это, возможно, самый энергозатратный, «капризный» и дорогой вычислительный процесс в истории человечества.
Перцептрон не понимает логику правил, он просто подгоняет миллиарды своих дробных чисел (весов) под правильный ответ.
Компьютер берет текст партии, скрывает последний ход и заставляет сеть угадать его. Сеть ошибается.
Ошибка математически просчитывается и пускается обратной волной по всей сети (Backpropagation), чтобы микроскопически изменить миллиарды весов. Этот процесс повторяется триллионы раз на терабайтах данных.
Малейший дисбаланс в обучающей выборке — например, если в базу данных попадет слишком много партий низкорейтинговых игроков или текстов с ошибками — и вся гигантская математическая структура перцептрона «поплывет». Модель начнет тупеть на глазах, закрепляя ложные статистические связи.
Чтобы перцептрон выдавал адекватный результат на любой хаотичный вход (будь то грамотная нотация, Сашин сленг или опечатки), его нужно буквально утопить в данных.
ИИ должен увидеть один и тот же шахматный дебют или языковой оборот в миллионах разных вариаций, контекстов и формулировок.
Только тогда в многослойной сети протаптывается стабильная, широкая «магистраль» весов, которая не разрушится от того, что пользователь переставил слова местами или назвал слона «лошадью». Если данных мало, сеть просто зазубрит конкретные строчки (эффект переобучения — Overfitting) и станет беспомощной при малейшем изменении запроса.
Черный ящик невозможности следить за процессом
Нет ни малейшей возможности подсмотреть за тем, что происходит внутри структуры многослойного персептрона. Точнее, подсмотреть можно, но что-либо понять и как-то делать выводы – нет. Внутри происходит такое непознаваемое колдунство, что такие системы называют “черными ящиками”. Это не просто досада, а принципиальная неуправляемость и неоптимизируемость.
Когда мы открываем обученную сеть, мы видим не логические блоки, а сотни миллиардов дробных чисел (весов). Каждое отдельное число само по себе не значит ничего. Смысл имеет только их колоссальное, одновременное, распределенное взаимодействие.
Один и тот же элемент многослойного персептрона может одновременно участвовать в распознавании шахматного коня, синего цвета, слова «лошадь» и синтаксиса французского языка. Вычленить, где заканчивается одно знание и начинается другое, математически невозможно. Мы можем распечатать все веса на бумаге, но это будет просто бесконечная простыня чисел, которая ничего не скажет нашему уму.
Если ИИ-шахматист совершает глупый ход сквозь фигуру на усеченной доске, программист не может зайти в код и поправить это место вручную.
Нельзя подкрутить три-четыре параметра, чтобы ИИ «запомнил» новое правило, не сломав при этом всё остальное.
Изменение даже одного веса на сотую долю процента вызывает эффект бабочки: сигнал пойдет по другим путям, и модель может внезапно разучиться генерировать программный код или начнет путать слова в стихах.
Единственный способ «исправить» модель — это снова запустить капризное, безумно дорогое обучение (градиентный спуск) на миллиардах новых примеров, надеясь, что сеть сама как-нибудь перенастроит свои внутренние миллиарды весов под новые требования.
Ученые создали целое направление — Interpretability (интерпретируемость ИИ). Они пытаются «демаскировать» чёрный ящик, сканируя активность нейронов во время работы.
Именно так ученые (в упомянутом ранее исследовании Карвонена) выяснили, что внутри GPT формируется виртуальная карта доски. Они увидели, что при подаче шахматного текста определенные группы нейронов синхронно «вспыхивают», реагируя на координаты.
Но даже это — лишь посмертный анализ. Мы видим, что внутри что-то срезонировало, но мы не можем этим управлять, не можем перестроить эту структуру «на лету» и не можем гарантировать, что в следующий миллисекунду сеть не выдаст безумную галлюцинацию.
Выводы
Многослойный персептрон — это величайший компромисс в истории вычислительной техники. В ситуациях, когда возникают такие противоречивые свойства явления, можно сказать определенно: несмотря на грандиозность осуществленного Тернсформера – этот механизм явно содержит внутренние противоречия и необходим прорыв в понимание альтернативного подхода в котором нет таких принципиальных бед.
Высшая точка развития современных ИИ-технологий (архитектура Трансформера в сочетании с многослойными перцептронами) уперлась в свой фундаментальный тупик. Тот факт, что для получения сверхбыстрого «понимания» контекста нам приходится мириться со слепыми галлюцинациями, капризным и астрономически дорогим обучением, а также полной непрозрачностью «черного ящика», доказывает: текущий подход исчерпал свою эволюционную логику.
Сегодня пока далеко от прогнозов, что лучшие умы создателей ИИ подходят к тому самому прорывному альтернативному подходу. Но он уже на виду, нужно только суметь увидеть. И это не развилка или доработка – это иной физический принцип.
Природная альтернатива персептронной организации
Почему здесь искусственные нейросети называются персептронами? Потому что нет никакой схожести с тем, как взаимодействует нейрона в мозге.
Нейрон не имеет возможность точно отрабатывать на сумму входных воздействий по сколь угодно точно установленным весам связей. Его порог очень нестабилен и позволяет различать не более 10 дискретов разницы воздействий. Изменилась температура – порог стал другим. Изменился химический состояв – опять порог поплыл. Поэтому в мозге нет многослойных персептронов.
Каждый нейрон – это локальный однослойный персептрон с довольно нестабильным порогом. Поэтому каждый из нейронов на входе имеет лишь небольшую долю общего рецептивного поля сигналов, перекрываясь во много с соседними нейронами. За счет взаимной тормозной связи улучшается контраст и конкурентность срабатывания детекторов совокупности входных сигналов.
За одним слоем таких нейронов следует следующий (а не вперемешку), используя выходы предыдущего слоя как рецепторные сигналы. С каждым слоем все более уточняется и унифицируется набор распознавателей образов, доходя до нейронов, где сходятся все виды рецепции (зрительной, слуховой осязательной и т.п.) и появляются детекторы, например, лица бабушки.
Слои созревают в строгой последовательности критических периодов формирования примитивов восприятия. Сначала самые простые, например, точки, линии разного направления, дуги т.п., потом на их основе начинает формироваться следующий слой более сложных образов.
Обучение не является какой-то особо сложной формой с повышенной энергетикой и сложностью. Оно очень естественно отбирает наиболее повторяющееся в окружении. Если у котенка ограничить восприятие вертикальных линий, то все последующие слоя будут обходиться без них и о вертикалях котенку придется судить как-то косвенно, например, по отбрасываемой тени.
Природа не создала наборы распознавателей в коре так, чтобы с ними рождались, потому что каждое существо должно приспосабливаться в окружающих условиях и это критически важно.
Система многослойных поочередно специализирующихся персептронов, как и многослойный персептрон, имеет принципиально одно время распознавания, и оно максимально быстро. Но в отличие, вся внутренняя кухня легко прослеживается и стимулируя нейрон красного пятна, мы в поле зрения видим это красное пятно. Каждый нейрон становится уникальным представителем своего образа, с точки зрения программирования у каждого нейрона – свой ID, с которым уже можно работать как с образом.
Вот почему “искусственные нейросети” – это просто лживый маркетинг. Термин «нейросеть» создаёт у обывателя (и даже у многих разработчиков) ложное представление, что мы воспроизводим принципы биологического интеллекта. Раньше он придавал сакраментальность многослойным попыткам, но сегодня, когда Трансформер стал открытием эффективности реализаций, в таком обмане нет необходимости и можно применить изначально корректный термин: “многослойный персептрон” (MLP).
У природной нейросети восприятия – та же проблема, возникающая как недостаточность обучения. Мало того, при полной достаточности обучения нейрон просто выдает сигнал превышения порога на входе, а сочетание активностей на входе может быть при этом самое различное, на уровне одного нейрона неразличимы изображения единицы и написанной в том же стиле семерки. Он не различает их — он просто фиксирует превышение порога. Существует множество примеров зрительных иллюзий, которые это демонстрируют.
Частично образы уточняются последующими детекторами, но окончательно галлюцинацию может обнаружить только внешняя структура, использующая ID образов. Смысл каждого образа формируется в определенном контексте. Предположительное распознавание происходит в структуре семантической памяти, по итогам предположительного распознавания – значимости предположения. Если видим что-то ярко красное, и в лицо пышет жар, то это, скорее всего, пламя. Смысл понимается всегда в определенном контексте – как то, что означает данный образ для субъекта в данных условиях (fornit.ru/66643). С опытов все более утоняется семантика воспринимаемых образов.
Поэтому в природном мозге нет никакой обработки статистики (кроме контраста выделяемой при многократной экспозиции образа – совпадающее дает более прочное, случайное уходит из образа). Вместо статистики последовательностей токенов есть только выделение абстракций в контексте данных условий и ситуации.
Сегодня есть полноценная модель всей иерархии организации значимостей, абстракций и понимания в теории МВАП (модель волевой адаптивности психики), которую можно использовать для разработки сильного ИИ и есть четыре искусственных существа (fornit.ru/102542), которые воплощают эту модель, позволяя наблюдать за всем процессами, вплоть до циклов осмысления.
Формирование последовательностей в мозгу
Когда шахматист играет партию блиц, он используется взаимосвязь элементов своей эпизодической памяти (fornit.ru/67560). Это эволюционно более новый вид памяти истории моментов осмысления, в которых сохраняются кадры стимула, ответной реакции на его и последствий в виде значимости для субъекта.
Шахматист имеет множество цепочек таких кадров, говорящих о том, что при таком-то ходе противника он так ответил и это принесло ему улучшение или ухудшение. Цепочки последовательностей, приводящие к успеху поставленной цели, в шахматах называют “комбинациями”. Даже если в цепочке есть кадры потерь, но в конце возникает крупное приобретение, такая цепочка желательна и используется, Цепочки, заканчивающиеся большой неудачей – избегаются.
Это похоже на то, как формируется последовательность в GPT, но здесь нет никакой статистики и бешенной сложности обучений. Если в Трансформере вся статистика исчерпывается весами при обучении, то в природе используются конкретные, локальные механизмы, опыт сосредоточен в отдельных структурах памяти и реализуется в ходе алгоритма осознания ситуации (fornit.ru/68516).
Эволюция постепенно усложняла обработку при осмыслении, сначала используя лишь семантическую память для понимания смыслов – того, что именно означает образ в текущих условиях.
Следующим уровнем – стало использование эпизодической памяти для быстрого поиска подходящего продолжения по цепочкам кадров.
Далее алгоритм усложнялся еще двумя уровнями, заканчивая творческой доминантой нерешенной проблемы (fornit.ru/69108).
В такой системе галлюцинирование – самый начальный этап адаптивности к проблеме, скорее говорящий о патологиях, чем о сбое всего механизма осознания. Галлюцинация в биологии — это не финальный ответ. Это начало процесса, который ведёт к обучению, к созданию нового знания, к адаптации.
Возможна ли альтернатива Трансформеру на новом физическом принципе?
В результате сотен миллионов лет экспериментов над всем спектром существ, живших на Земле, природа выработала наиболее совершенную форму реализации системы индивидуальной адаптивности – то, что мечтах построителей ИИ называется сильным ИИ. При этом природа не ограничивалась только одним каким-то принципом типа статистического нахождения очередного элемента последовательности и даже механизм, который можно было бы сопоставить с Трансформером, реализован совершенна на иных принципах. Использовать только что-то одно, не замечая остального – большой, разумно не объяснимый нонсенс у современных AI конструкторов.
Природа не ограничилась индивидуальными адаптивными системами и даже на уровне формирования каждого из субъектов, она использует социум для отзеркаливания опыта многих каждым, кому такой опыт окажется необходим. Это порождает из индивидуального гомеостата – основы регуляции с использованием значимостей, социальный гомеостаз, которые во многом более важен для особи, чем собственная норма жизненных параметров (fornit.ru/102714).
В рассмотренном смысле развить Трансформер в его существующем виде, который итак уже достигает пределов своих возможностей, невозможно. Нельзя взять и как-то прицепить к Трансформеры находки эволюции или наоборот, усилить природную реализацию включением в организм Трансформер – это совершенно несовместимые системы. Мы пользуемся трансформером внешним интерфейсом, как пользуемся калькулятором или компьютером, которые так же придают нам особые дополнительные возможности.
Место Транстформера в ряду прогресса – использование статистики огромного массива человеческого опыта как обобщающего справочника, что и определяет корректные условия его применения. Пытаться творить что-то Трансформером невозможно, природа нашла всего два принципа нахождения новых идей (fornit.ru/102720) и это вообще далеко от статистики языковых моделей.
Трансформеры тем полезнее, чем больший опыт людей накоплен в направлении поиска и задаваемого промпта. В пределе, если нет опыта – получаем сплошные галлюцинации. Поэтому всякий раз при задании придумать что-то новое и крутое, будет даваться статистический результат уже придуманного или очередный глюк, который система никак не распознает сразу.
Да, как и в случае внедрения калькулятором мы разучаемся считать в уме и в столбик, становясь зависимыми, но при разумном использовании даже этот минус обходится (fornit.ru/102687).
Попытка переложить на трансформеры отдельные виды человеческой деятельности ограничены только в отдельных элементах справочного применения совокупного опыта. В качестве справочников для процессов сопоставления и обобщения лучше Транстформеров нет ничего сегодня. Но окончательный итог процессов сопоставления и обобщения требует дополнительных механизмов, которыми не обладает Трансформер. Несмотря на все ухищрения придать процессу видимость разумной аналитики, хотя эти ухищрения повышают качество использования и во многом даже маскируют неистребимые галлюцинации.
Если природа внедрила социальный гомеостат, то можно представить искусственное сообщество отдельных носителей жизненного опыта, набираемого не путем мощного вливания потока данных с массированными погрешностями и переделками, а по каждому отдельному факту попыток адаптивности. корректируемых самой реальностью, но с оценкой эгоцентрической значимости (fornit.ru/100025). Если придать таким существам возможность постоянной взаимосвязи по радиоканалу, то будет развиваться общая система сильного интеллекта обобщенного, самого актуального и выверенного опыта, подключение к которой даст принципиально новые возможности.
Думки о том, как обуздать такой суперинтеллект, не сделав врагом, сегодня основываются на программном внедрении системы безусловных запретов. Но фантасты давно показали иллюзорность надежности и покорности этого способа. При развитии отдельных индивидуумов AGI они сразу должны основываться н а дружественных людям и другим живым существам жизненных параметрах (fornit.ru/102618), так что проблема антагонизма снимается, даже не начав хоть в чем-то проявляться.
Трансформер — это справочник, а не разум
Трансформер — это величайший справочник в истории человечества. Он обобщает опыт, накопленный в текстах, и выдаёт его с невиданной скоростью. Но он не понимает этот опыт. Он не творит. Он не адаптируется. Он не учится на ошибках в реальном времени.
Пытаться сделать из Трансформера сильный ИИ — это всё равно что пытаться сделать из энциклопедии живого собеседника. Энциклопедия может ответить на любой вопрос, если ответ в ней записан. Но она не поймёт новый вопрос, если ответа в ней нет.
Природа нашла другой путь — социальный гомеостат, где опыт каждого становится достоянием всех, где ошибка становится сигналом к адаптации, где творчество возникает из перекомбинации абстракций, а не из статистического перебора.
Мы стоим перед выбором. Продолжать улучшать справочник, делая его всё больше и быстрее? Какое-то время так и будет продолжаться. Или начать строить систему, которая действительно понимает, адаптируется и творит — на тех принципах, которые природа оттачивала сотни миллионов лет? Но разрабы ИИ должны суметь его увидеть и понять, ведь МВАП уже состоявшаяся модель, хотя игнорируется занятыми другими важными делами специалистами (fornit.ru/102746). Можно использовать сами системы GPT для того чтобы получить основу для выводов по безальтернативности МВАП сегодня: fornit.ru/100040, fornit.ru/69802.
Это не развилка. Это — иной физический принцип.
