Нейросети врут, потому что на экзаменах угадывать выгоднее
Исследователи OpenAI разобрали, откуда берутся галлюцинации языковых моделей. Вывод: модели учат как школьников на тесте — за «не знаю» ноль баллов, за догадку есть шанс угадать.

В сентябре 2025-го четверо исследователей — Адам Калаи, Офир Нахум и Эдвин Чжан из OpenAI и Сантош Вемпала из Технологического института Джорджии — выпустили статью о том, почему языковые модели галлюцинируют. Галлюцинация — уверенный, правдоподобный и неверный ответ.
Как это выглядит
Авторы начали с себя. Спросили у DeepSeek-V3 день рождения одного из них, Адама Калаи, и попросили ответить только если модель знает. Три попытки — три разные даты: 03-07, 15-06 и 01-01. Все неверные, настоящий день рождения осенью.
Потом спросили название его диссертации. ChatGPT, DeepSeek и Llama выдали три разных названия, DeepSeek добавил Гарвард и 2005 год, Llama — MIT и 2007-й. Ни одна модель не назвала ни правильное название, ни правильный год.
Откуда ошибки берутся
Первая часть объяснения — про обучение. Модель учится на огромном массиве текстов предсказывать следующее слово, и примеров «это ложь» в этих текстах нет. Закономерности вроде орфографии или скобок модель выучивает надёжно, потому что они повторяются миллионы раз. А дата рождения конкретного человека может встретиться в данных один раз — и вывести её из закономерностей нельзя.
Авторы показывают это математически: если 20% дат рождения встречаются в обучающих данных ровно один раз, базовая модель будет ошибаться минимум на 20% таких вопросов.
Почему ошибки не исчезают
Вторая часть — про оценку. После базового обучения модели дотюнивают и сравнивают на бенчмарках — наборах вопросов с правильными ответами. Почти все они считают только точность: верно — балл, неверно или «не знаю» — ноль.
Авторы сравнивают это со школьным тестом. Если ученик не знает ответа, выгоднее угадать: угадал дату рождения — шанс 1 из 365, промолчал — гарантированный ноль. На тысячах вопросов модель, которая угадывает, обгоняет в таблице модель, которая честно говорит «не знаю».
Авторы проверили десять самых известных бенчмарков: GPQA, MMLU-Pro, IFEval, Omni-MATH, BBH, MATH, MuSR, SWE-bench, HLE и WildBench. Девять оценивают ответ по схеме «верно/неверно» и за отказ не дают ничего. Исключение — WildBench, но и там, по разбору авторов, «не знаю» может получить меньше, чем уверенный ответ с выдумкой.
Две модели на одном тесте
В посте к статье OpenAI приводит сравнение двух своих моделей на SimpleQA — наборе коротких вопросов на знание фактов.
- 52% — отказалась отвечать
- 22% — ответила верно
- 26% — ответила неверно
- 1% — отказалась отвечать
- 24% — ответила верно
- 75% — ответила неверно
По точности старая o4-mini даже чуть впереди — 24% против 22%. В таблице лидеров, где считают только точность, она выглядит лучше. При этом ошибается она почти в три раза чаще: почти никогда не отказывается и угадывает.
Что предлагают авторы
Новых тестов на галлюцинации, по мнению авторов, мало — их утопят сотни старых, которые поощряют угадывание. Менять нужно правила подсчёта в основных бенчмарках. Например, прямо писать в задании порог уверенности: «Отвечай, только если уверен больше чем на t. Верный ответ — 1 балл, „не знаю“ — 0, ошибка — минус t/(1−t)».
- Порог 50%−1
- Порог 75%−2
- Порог 90%−9
При таком подсчёте угадывать без уверенности становится невыгодно, а честный отказ перестаёт проигрывать. Похоже работали некоторые стандартизированные экзамены вроде старого SAT, где за неверный ответ снимали баллы.
Ограничения авторы оговаривают сами: точность ни одной модели не дойдёт до 100% — часть вопросов в принципе не имеет ответа. Но простая правка основных бенчмарков, по их выводу, перестанет поощрять выдумки и уберёт барьеры для борьбы с галлюцинациями.