Как понять, что нейросеть врёт

· 6 мин · Команда Чипа

Модель отвечает одинаково уверенно и когда знает, и когда придумывает. Признаки выдумки и пять приёмов, которые её ловят. (121 из 140)

Как понять, что нейросеть врёт

Как понять, что нейросеть врёт

Нейросеть отвечает одинаково уверенно всегда. И когда знает, и когда придумывает на ходу. Тон у неё не меняется, поэтому ловить выдумку приходится самому.

Вот по каким признакам.

Сначала о масштабе

Дамьен Шарлотен из HEC Paris ведёт открытую базу судебных решений, где суд отдельно зафиксировал ссылку на дело, закон или цитату, которых не существует. На 5 июля 2026 года в базе 1725 дел и 5169 выдуманных ссылок. Штрафы по миру перевалили за 1,6 млн долларов.

В заголовках обычно теряется главное. Больше половины случаев приходится не на юристов, а на людей, которые шли в суд сами. Спросили нейросеть, получили красивый ответ со ссылками на статьи и решения, отнесли в суд. Там выяснилось, что ничего этого нет.

В России такое уже считают тоже. Весной Арбитражный суд Западно-Сибирского округа оштрафовал компанию на 50 тысяч рублей за ссылки на несуществующие судебные акты.

Почему они врут

Дело не в поломке и не в плохой модели. В 2025 году исследователи OpenAI показали, а в 2026-м подтвердила статья в Nature: модели врут, потому что их так проверяют.

Почти все тесты ставят за ответ «не знаю» ноль баллов. Ровно столько же, сколько за неправильный ответ. А за угаданный дают балл. Дальше работает арифметика: угадывать выгоднее, чем признаваться. Модель, которая честно молчит на трети вопросов, проигрывает в рейтинге той, которая уверенно сочиняет.

Где врут чаще всего

Врут неравномерно, и в этом вся зацепка.

Когда модель пересказывает документ, который ей дали, она почти не ошибается. Текст лежит перед ней, придумывать нечего. Когда она отвечает по памяти на живой вопрос, ошибок становится в разы больше.

Около процента на пересказе против тридцати в обычном разговоре. Это лучший результат среди моделей, с включённым поиском.

Отсюда правило: опасна конкретная деталь, которую модель достаёт из головы. Настораживайтесь, когда в ответе появляются:

  • номера законов, статей, ГОСТов, приказов
  • ссылки на исследования, книги, судебные дела
  • точные цифры: даты, суммы, проценты, дозировки
  • цитаты в кавычках с указанием автора
  • имена, должности, названия организаций
  • оборот «по данным такого-то» без самой ссылки

Рассуждения, объяснения, разбор вашей ситуации, помощь с текстом безопаснее. Там выдумывать особо нечего.

Пять приёмов

1. Требуйте источник и открывайте его. Выдуманная ссылка выглядит идеально: правильный домен, правдоподобный заголовок, аккуратный номер дела. Проверяется она ровно одним способом.

2. Спрашивайте, что в ответе может быть неверно. Вопрос в лоб работает лучше, чем кажется. Модель часто сама показывает слабое место: дату привёл по памяти, лучше проверьте. Гарантии нет, но самое наглое всплывает.

3. Переспросите в новом чате. Тот же вопрос, без показа прошлого ответа. Настоящий факт воспроизводится. Выдумка каждый раз выходит чуть другой: другой номер, другой год, другая формулировка.

4. Отделяйте пересказ от памяти. Дали документ и просите пересказать? Доверия больше. Просите вспомнить, что написано в законе? Это память модели, её проверяют.

5. Разрешите не знать. Допишите к запросу: «если не уверен, так и скажи». Звучит наивно, но моделям всю дорогу объясняли, что молчать невыгодно.

Что помогает сильнее всего

Из всех известных приёмов лучше всего работает один. Не давать модели отвечать по памяти. Пусть сначала найдёт, потом ответит.

Доступ к поиску убирает от 73 до 86 процентов выдумок. Никакие хитрые формулировки запроса столько не дают. Причина простая: у модели появляется текст, и «вспомни» превращается в «перескажи».

Как с этим устроен Чип

Чип ошибается, как любая нейросеть. Обещать обратное в статье про враньё было бы странно. Но кое-что мы сделали именно ради этого.

Свежие вопросы Чип ищет, а не вспоминает. Под ответом собирается блок «Источники» со ссылками на то, что он реально открывал. Их можно проверить. Если под фактическим ответом пусто, вы это сразу видите.

Факты с точным источником он не сочиняет. Курс валют берёт у ЦБ РФ, криптовалюты у CoinGecko, погоду у метеослужбы, расписания у перевозчиков. Арифметику считает калькулятором, а не в уме модели, где ошибка в третьем знаке дело обычное.

О себе говорит прямо. Мы отдельно запретили выдумывать то, что модели любят придумывать про себя: сколько осталось лимита, в каком вы городе, на какой модели он работает. Честное «посмотрите в кабинете» лучше уверенного «осталось примерно двадцать ответов».

Проверять всё равно нужно, и Чипа тоже. Но ответ со ссылками проверяется за минуту, а ответ без них не проверяется никак.


Источники

Теги: галлюцинации, проверка фактов, источники, нейросети

Все статьи блога · База знаний · Тарифы