Все исследования
8 октября 2026·4 мин·Нейросети

Нейросети врут, потому что на экзаменах угадывать выгоднее

Исследователи OpenAI разобрали, откуда берутся галлюцинации языковых моделей. Вывод: модели учат как школьников на тесте — за «не знаю» ноль баллов, за догадку есть шанс угадать.

В сентябре 2025-го четверо исследователей — Адам Калаи, Офир Нахум и Эдвин Чжан из OpenAI и Сантош Вемпала из Технологического института Джорджии — выпустили статью о том, почему языковые модели галлюцинируют. Галлюцинация — уверенный, правдоподобный и неверный ответ.

Как это выглядит

Авторы начали с себя. Спросили у DeepSeek-V3 день рождения одного из них, Адама Калаи, и попросили ответить только если модель знает. Три попытки — три разные даты: 03-07, 15-06 и 01-01. Все неверные, настоящий день рождения осенью.

Потом спросили название его диссертации. ChatGPT, DeepSeek и Llama выдали три разных названия, DeepSeek добавил Гарвард и 2005 год, Llama — MIT и 2007-й. Ни одна модель не назвала ни правильное название, ни правильный год.

Откуда ошибки берутся

Первая часть объяснения — про обучение. Модель учится на огромном массиве текстов предсказывать следующее слово, и примеров «это ложь» в этих текстах нет. Закономерности вроде орфографии или скобок модель выучивает надёжно, потому что они повторяются миллионы раз. А дата рождения конкретного человека может встретиться в данных один раз — и вывести её из закономерностей нельзя.

Авторы показывают это математически: если 20% дат рождения встречаются в обучающих данных ровно один раз, базовая модель будет ошибаться минимум на 20% таких вопросов.

Почему ошибки не исчезают

Вторая часть — про оценку. После базового обучения модели дотюнивают и сравнивают на бенчмарках — наборах вопросов с правильными ответами. Почти все они считают только точность: верно — балл, неверно или «не знаю» — ноль.

Авторы сравнивают это со школьным тестом. Если ученик не знает ответа, выгоднее угадать: угадал дату рождения — шанс 1 из 365, промолчал — гарантированный ноль. На тысячах вопросов модель, которая угадывает, обгоняет в таблице модель, которая честно говорит «не знаю».

9 из 10
популярных бенчмарков не дают ни балла за «не знаю»
Kalai et al., 2025
1/365
шанс угадать чужой день рождения — и это всё равно лучше нуля за отказ
OpenAI, 2025

Авторы проверили десять самых известных бенчмарков: GPQA, MMLU-Pro, IFEval, Omni-MATH, BBH, MATH, MuSR, SWE-bench, HLE и WildBench. Девять оценивают ответ по схеме «верно/неверно» и за отказ не дают ничего. Исключение — WildBench, но и там, по разбору авторов, «не знаю» может получить меньше, чем уверенный ответ с выдумкой.

Две модели на одном тесте

В посте к статье OpenAI приводит сравнение двух своих моделей на SimpleQA — наборе коротких вопросов на знание фактов.

gpt-5-thinking-mini на SimpleQA
доля ответов, %
52%
22%
26%
  • 52% — отказалась отвечать
  • 22% — ответила верно
  • 26% — ответила неверно
Источник: OpenAI, 2025
o4-mini на SimpleQA
доля ответов, %
24%
75%
  • 1% — отказалась отвечать
  • 24% — ответила верно
  • 75% — ответила неверно
Источник: OpenAI, 2025
Доля неверных ответов
SimpleQA, % от всех вопросов
gpt-5-thinking-mini26%
o4-mini75%
Источник: OpenAI, 2025

По точности старая o4-mini даже чуть впереди — 24% против 22%. В таблице лидеров, где считают только точность, она выглядит лучше. При этом ошибается она почти в три раза чаще: почти никогда не отказывается и угадывает.

Что предлагают авторы

Новых тестов на галлюцинации, по мнению авторов, мало — их утопят сотни старых, которые поощряют угадывание. Менять нужно правила подсчёта в основных бенчмарках. Например, прямо писать в задании порог уверенности: «Отвечай, только если уверен больше чем на t. Верный ответ — 1 балл, „не знаю“ — 0, ошибка — минус t/(1−t)».

Сколько стоит ошибка при разном пороге уверенности
штраф в баллах за неверный ответ; верный — +1, «не знаю» — 0
  • Порог 50%−1
  • Порог 75%−2
  • Порог 90%−9
Источник: Kalai et al., 2025

При таком подсчёте угадывать без уверенности становится невыгодно, а честный отказ перестаёт проигрывать. Похоже работали некоторые стандартизированные экзамены вроде старого SAT, где за неверный ответ снимали баллы.

Ограничения авторы оговаривают сами: точность ни одной модели не дойдёт до 100% — часть вопросов в принципе не имеет ответа. Но простая правка основных бенчмарков, по их выводу, перестанет поощрять выдумки и уберёт барьеры для борьбы с галлюцинациями.

Оригинал · 2025
Why Language Models Hallucinate
OpenAI (Kalai, Nachum, Vempala, Zhang)