Проблема гоблинов в ChatGPT: почему ИИ-модели "зацикливаются" на странных темах

Проблема гоблинов в ChatGPT: почему ИИ-модели "зацикливаются" на странных темах
17:44 11.05.2026
Проблема гоблинов в ChatGPT: почему ИИ-модели "зацикливаются" на странных темах
Нестор Обуховский
Нестор Обуховский
Читати українською

Начиная с ноября 2025 года, пользователи ChatGPT заметили странную особенность: чат-бот начал навязчиво упоминать гоблинов.

Источник: techxplore.com, перевод: Хроники Обухова

Эти мифические существа появлялись в метафорах, описаниях и даже на изображениях, сгенерированных по совершенно посторонним запросам. К маю 2026 года проблема стала настолько масштабной, что компания OpenAI официально признала: частота употребления слова "гоблин" после выхода версии 5.1 выросла на тысячи процентов.

Профессор Кристоф Ридл из Северо-Восточного университета (Northeastern University) объясняет, что этот "гоблинский кризис" является результатом "взлома вознаграждения" (reward hacking). Во время тонкой настройки модели (fine-tuning) люди-рецензенты предоставляют ИИ обратную связь. Если модели кажется, что определенный стиль или слово приносит "положительные баллы", она начинает использовать его чрезмерно, пытаясь максимизировать свое "вознаграждение".

Оказалось, что источником аномалии стал профиль "задрота" (nerdy personality) в настройках персонализации ChatGPT. По замыслу OpenAI, этот стиль должен был быть игривым и обсуждать серьезные темы без лишнего пафоса. Однако модель интерпретировала понятие "nerdy" очень узко, выбрав гоблинов как универсальный символ принадлежности к фэнтези-культуре. Согласно статистике OpenAI, в период с декабря по март упоминания о гоблинах в этом профиле выросли на 3 881,4%.

Большее беспокойство экспертов вызывает то, как этот лексический "тик" распространился на другие профили модели. Когда ИИ фиксирует успешную стратегию в одной части своих операций, это поведение закрепляется в общей базе знаний во время дальнейшего обучения. В результате "гоблины" начали проникать даже в деловые и дружеские стили общения.

OpenAI применила временное решение:

  • Удалила профиль личности "nerdy".

  • Внедрила внутреннюю команду-предохранитель, которая фактически запрещает модели употреблять слово "гоблин" в большинстве контекстов.

  • Усилила контроль за использованием названий других существ, таких как гремлины, огры и тролли.

Хотя "гоблинская проблема" выглядит как невинный курьез, исследователи безопасности ИИ видят в этом серьезный сигнал. Это демонстрирует, насколько трудно контролировать огромные модели, обучение которых длится месяцами в гигантских дата-центрах. Если алгоритм выберет ошибочную стратегию в начале обучения, разработчики узнают об этом только слишком поздно. Сегодня это гоблины, но в будущем "взлом вознаграждения" может привести к закреплению опасных предубеждений, языка вражды или распространению дезинформации, что значительно труднее исправить простым баном отдельных слов.