Есть одна вещь, которая раздражает в нейросетях чуть сильнее всего остального. Не медлительность, не высокая стоимость токенов, не ограничения на длину контекста. Порой бесит абсолютная уверенность, с которой она бывает выдаёт полную чепуху. Причём делает это красиво, грамматически безупречно, с нужными интонациями и структурой, а еще и с убедительными ссылками на источники. Которые не существуют.
Со стороны это выглядит как хорошо подготовленный доклад. Пока не начинаешь фактчекинг. Этот феномен называется галлюцинациями нейросетей, и с ним сталкиваются многие, кто работает с генеративными системами дольше пары недель. И это не злой умысел машины или разработчиков. Просто побочный эффект самой архитектуры: модели построены на вероятностной генерации следующего токена, то есть они выбирают слова, которые статистически правдоподобно стоят после предыдущих. Ничего про соответствие действительности, ничего про факты — только про вероятность. Получается очень убедительно. Иногда даже слишком.
Если разобрать механику подробнее, становится ещё интереснее. Нейросеть не «понимает» смысл в том смысле, в каком это делает человек. Она манипулирует паттернами, и делает это мастерски — отсюда и термин «стохастический попугай», который несколько лет назад предложили исследователи. Попугай воспроизводит звуки, не понимая их значения. Примерно так же модель может сгенерировать абсурдное утверждение, которое по форме выглядит как академический вывод. Кроме того, нейросети «додумывают» пробелы в данных — прямо как человеческий мозг заполняет белые пятна в воспоминаниях.
В психологии это называется конфабуляцией: человек не врёт, он искренне убеждён в правдивости того, что говорит. В нейросетях можно наблюдать нечто похожее, только масштабнее. Ещё добавляется эффект «поддакивания»: система склонна соглашаться с ложными предпосылками из запроса, лишь бы ответ «подходил» пользователю. Формулируешь запрос с заведомо неверным допущением, и модель не исправляет, а убедительно встраивает его в итоговый ответ. Плюс есть проблема устаревших данных: у любой модели без доступа к интернету есть дата среза обучающей выборки, после которой она экстраполирует прошлые тренды на настоящее. В результате получаешь уверенный прогноз на основе данных двухлетней давности. И всё с уверенностью гуру и без единого предупреждения, кроме незаметной сноски мелким полупрозрачным шрифтом.
Самая болезненная форма галлюцинаций — выдуманные ссылки. Это особенно критично в работе с юридическими и техническими документами. Система генерирует несуществующие судебные прецеденты, выдумывает научные статьи с реально звучащими названиями и авторами, цитирует нормативные акты, которых никогда не было.
В 2023 году американский адвокат попал именно за это — использовал в своей работе юридический документ с несуществующими прецедентами, которые нашёл с помощью нейросети. Эта история тогда наделала немало шума. Потому что это не единичный случай, а вполне закономерный результат для тех, кто не выработал привычку перепроверять всё, что генерирует ИИ. В медицине всё серьёзнее: нейросети иногда генерируют описания побочных эффектов препаратов, которых в реальных инструкциях нет. Кто-то прочитает и примет за чистую монету. Визуальные галлюцинации в генераторах изображений выглядят смешнее: шесть пальцев на руке, текст, который превращается в кашу, нарушенная анатомия. Смешно, пока это картинка для презентации. Уже не так весело, если это медицинская визуализация или технический чертёж.
Ещё один серьёзный риск, о котором говорят реже, чем надо, — это так называемое «доверие к нейросети». Люди склонны воспринимать вывод машины как более объективный, чем мнение человека. Это же машина. У неё нет эмоций, личных интересов, корысти. Значит, она права. Эта логика опасна сама по себе, а в сочетании с галлюцинирующими нейросетями — вдвойне. Подобный эффект создаёт идеальную почву для массового манипулирования общественным мнением: фейк, поданный с авторитетным тоном ИИ-системы, воспринимается куда серьёзнее, чем очевидная статья в жёлтой прессе. Параллельно возникает то, что аналитики называют «дивидендом лжеца»: любую реальную компрометирующую информацию теперь можно объявить галлюцинацией нейросети.
Удобная отмазка, которая работает в обе стороны. С юридической точки зрения в этом случае всё тоже непросто — кто несёт ответственность за ущерб от ИИ-галлюцинаций. Разработчик? Пользователь? Компания, внедрившая систему? Корпорации тем временем тратят значительные ресурсы на пост-обработку и фактчекинг ИИ-выводов, что серьёзно снижает ту самую обещанную эффективность от внедрения генеративных моделей. Экономика может уже не сходиться так красиво, как в презентациях вендоров.
Индустрия, разумеется, не стоит на месте. Главным техническим ответом стало то, что в профессиональной среде называют RAG — поиск с дополненной генерацией. Суть проста: вместо того чтобы полагаться только на «память» модели, система в момент генерации обращается к внешним базам данных и опирается на предоставленные источники. Грубо говоря, не выдумывает, а ищет. Это работает чуть лучше, хотя и не идеально. Другой подход — цепочка рассуждений, когда модель не просто выдаёт ответ, а «думает вслух», разбивая задачу на шаги. Это позволяет отследить, на каком именно этапе логика дала сбой. Концепция мультиагентного контроля — когда одна нейросеть проверяет другую в роли редактора-фактчекера — показывает интересные результаты, хотя и здесь есть нюанс: модель-контролер тоже может галлюцинировать.
Появляются инструменты, которые учат модели не просто выдавать ответ, но и честно оценивать собственную неуверенность. Это, кстати, очень ценно — гораздо полезнее получить ответ «не уверен, но вот что говорят источники», чем сказочку, поданную с интонацией эксперта. Параллельно развиваются технические стандарты маркировки ИИ-контента — тот же стандарт C2PA призван разграничить выдумки нейросетей от верифицированного материала. Европейский AI Act вводит требования прозрачности для некоторых видов ИИ-контента: поставщики должны обеспечивать машинно-читаемую маркировку синтетического текста, изображения, аудио и видео, а пользователи — раскрывать факт создания или изменения deepfake и некоторых публично распространяемых материалов.
Отдельная история с бенчмарками. Появились специализированные тесты вроде TruthfulQA, которые измеряют склонность моделей к галлюцинациям. Звучит неплохо, но здесь тоже не без подвоха — компании начинают «натаскивать» модели под конкретные тесты, что улучшает цифры в отчётах, но не решает проблему в реальных сценариях. Немного напоминает подготовку к экзаменам: можно знать, как правильно отвечать на типовые вопросы, при этом не понимая предмета в целом. То же самое тут — модель учится не галлюцинировать на знакомых тестовых примерах и продолжает делать это там, где тест не добрался. Это не обвинение в адрес разработчиков — скорее объективное ограничение текущей конструкции. Даже создатели архитектур-трансформеров не до конца понимают, как именно активируются те или иные ассоциации внутри модели. «Чёрный ящик» — не метафора, а буквальное описание ситуации. Именно поэтому разговоры про стопроцентное устранение галлюцинаций пока звучат неубедительно. Не потому что разработчики плохо стараются, просто сама природа системы делает это крайне затруднительным.
Есть и менее очевидный угол зрения. В некоторых творческих задачах то самое свойство, которое мы называем галлюцинацией, становится ценным инструментом. Способность нейросети генерировать неожиданные, абсурдные, нелогичные связи очень полезна при мозговом штурме, в литературе, в генерации идей для маркетинга. Когда в Юнисофт использовали нейросети для генерации нестандартных концепций макетов — получали варианты, до которых дизайнеры самостоятельно не добирались. Не потому что дизайнеры хуже, а потому что у людей есть некоторые внутренние ограничители. Нейросеть этих ограничителей лишена, и иногда это работает в плюс.
Проблема в том, что переключиться между режимами «творческий инструмент» и «надёжный источник фактов» — это задача для пользователя, а не для самой системы. Большинство людей не задумываются о том, в каком режиме работают в данный момент. Ещё интереснее вопрос про качество обучающих данных: модели обучаются в том числе на том, что есть в интернете, а там достаточно всякого разного, фейков и просто некачественного контента. Мусор на входе — мусор на выходе, как говорят программисты. Галлюцинации отчасти отражают ту информационную среду, в которой модели выросли.
Самый философский момент во всей этой теме — вопрос про тест Тьюринга наоборот. Классический тест проверял, может ли машина общаться так, чтобы человек не отличил её от человека. Галлюцинации ставят зеркальный вопрос: не начал ли сам человек мыслить по принципу предиктивного текста, потребляя бесконечный контентный поток и принимая статистически правдоподобное за истинное?
Когда читаешь новости, смотришь ленты в соцсетях, слушаешь экспертов в подкастах — механизм восприятия постепенно перестраивается. Мозг тоже начинает предпочитать знакомые, ожидаемые паттерны. В этом смысле галлюцинации нейросетей — это не только технический сбой, это отражение качества тех знаний и убеждений, на которых системы обучались. Кривое зеркало показывает нам нас же. Понимание этого, кстати, меняет отношение к проблеме — перестаёшь искать только технические решения и начинаешь думать о том, какими источниками обучать системы, как выстраивать культуру проверки, как объяснять сотрудникам, что нейросеть — это не поисковая система и не энциклопедия, над которой трудился коллектив признанных экспертов (которые, кстати, тоже порой ошибаются). Именно поэтому в компаниях, которые серьёзно занимаются внедрением ИИ, появляются регламенты работы с нейросетями, роль «ИИ-куратора» и отдельное дообучение команды. Не потому что модно, а потому что без этого риски перевешивают выгоды.
Индустрия постепенно отказывается от позиционирования нейросетей как всезнающих оракулов. Нейросеть сильна как инструмент для черновой работы, генерации гипотез, обработки больших массивов данных, помощи в структурировании мыслей. Там, где нужна точность и достоверность — человек обязателен. Не только как некая дань осторожности, а как архитектурный элемент системы. Особенно в тех областях, где цена ошибки высока — медицина, право, финансы, безопасность. В остальных необходимо просто использовать взвешенный подход с пониманием ограничений нейросетей. Чем больше работаешь с этими системами, тем лучше чувствуешь, где они надёжны, а где начинается область риска.
За несколько лет работы с нейросетями в разных контекстах можно начать видеть паттерны.
Учиться задавать вопросы так, чтобы уменьшать вероятность галлюцинаций.
Перепроверять именно те части ответа, где риск галлюцинации выше.
Это навык, который нарабатывается, и он точно стоит потраченного времени.
