Нейросети в разработке игр и квизов: что реально помогает
Нейросеть экономит мне несколько дней на каждом новом пакете вопросов и при этом уверенно врёт в фактах. Рассказываю без восторгов и без паники, что она реально делает в моей работе, где её нельзя подпускать к результату и как устроена проверка.
Зачем я вообще этим занялся
Самая долгая часть моей работы — не проведение игры, а написание содержания. Пакет на час квиза пишется несколько дней, и большая часть этого времени уходит не на творчество, а на перебор: сформулировать двадцать вариантов, чтобы оставить пять. Нейросеть закрывает ровно перебор, и это её единственная роль в моём процессе. Всё, что связано с достоверностью и с попаданием в конкретную аудиторию, остаётся человеку.
У меня прикладная информатика по образованию, так что интерес был двойной: и как у автора игр, и как у человека, который делает платформы. За несколько лет практики сложился рабочий цикл, где нейросеть занимает три места и ни на шаг больше.
Что реально ускоряется
| Задача | Что делает нейросеть | Экономия |
|---|---|---|
| Черновики вопросов | Выдаёт тридцать вариантов по теме за минуту | Заметная: перебор вручную занимает часы |
| Переформулировка | Переписывает готовый вопрос в пяти вариантах длины и сложности | Высокая, особенно при адаптации пакета под другой возраст |
| Дистракторы | Предлагает правдоподобные неверные варианты ответа | Средняя: половину придётся выбросить, но идею дают |
| Текст правил | Превращает мою схему механики в связную инструкцию | Высокая, но требует полной вычитки |
| Вёрстка и код | Разметка экранов, шаблоны, рутинные куски кода платформы | Очень высокая, здесь ошибка видна сразу |
| Проверка фактов | Ничего. Именно здесь она опаснее всего | Отрицательная |
Обратите внимание на последнюю строку. Она и есть главное содержание этой статьи.
Где нейросеть врёт
Языковая модель выдаёт правдоподобный текст, а не проверенный факт. Обзоры проблемы галлюцинаций описывают это как системное свойство: модель оптимизирована на угадывание следующего слова, и уверенный неверный ответ для неё дешевле, чем признание незнания. В работе с квизами это выглядит так: даты сдвигаются на год-два, авторство приписывается более известному человеку, цифра выглядит убедительно и не подтверждается нигде.
Самое коварное в том, что ошибка приходит в идеальной обёртке. Вопрос сформулирован красиво, ответ звучит уверенно, ссылка на источник выглядит настоящей. Я несколько раз ловил себя на желании поверить, потому что текст был лучше, чем я написал бы сам. Ровно в этом месте квиз и превращается в источник дезинформации, а ведущий — в человека, который спорит с командой и оказывается неправ.
Ни один факт, пришедший от нейросети, не попадает в игру без подтверждения из первоисточника. Не из другого чата и не из выдачи поисковика с пересказом, а из документа, справочника или официального сайта. Особенно это касается дат, цифр, имён, названий и всего, что выглядит как точная статистика. Ссылки на исследования, полученные от модели, проверяются по DOI: несуществующие ссылки встречаются регулярно.
Мой рабочий цикл
Так выглядит подготовка пакета из двенадцати вопросов по школьной теме. Черновиков всегда генерируется втрое больше, чем нужно: отсев — обязательная часть, а не признак плохого промпта.
- Задаю рамку сам
Тема, возраст, что именно должно вспомниться, сколько вопросов, какой тип ответа. Без жёсткой рамки модель выдаёт вопросы «про всё», которые ничего не проверяют.
- Генерирую тридцать черновиков
Прошу разной сложности и разного типа: на факт, на сравнение, на поиск ошибки. Одинаковые по типу вопросы — первый признак ленивого запроса.
- Выбрасываю две трети
Уходит всё, что проверяет узнавание слова, а не понимание; всё слишком общее; всё, где ответ угадывается из формулировки.
- Проверяю факты руками
Каждый оставшийся вопрос сверяю с первоисточником. Этот шаг занимает больше времени, чем вся генерация, и сократить его нельзя.
- Переписываю формулировки
Модель пишет гладко и обезличенно. Живой вопрос требует конкретики и интонации, которую знает только тот, кто ведёт эту аудиторию.
- Прогоняю на людях
Финальный фильтр. На прогоне вылезает то, чего не видно в тексте: двусмысленность, случайная подсказка в соседнем вопросе, неудачный порядок.
Проверка фактов: как это выглядит на практике
Проверяю по трём уровням строгости, в зависимости от того, чем вопрос грозит. Цифра и дата — самый строгий уровень, потому что именно на них команда спорит и оказывается права.
- Цифры, даты, имена, названия. Только первоисточник: официальный документ, сайт организации, статистический сборник, научная публикация по DOI. Пересказы не считаются.
- Общеизвестные факты. Достаточно двух независимых надёжных источников, но именно двух: единственное совпадение часто означает, что оба текста восходят к одной и той же ошибке.
- Формулировки и трактовки. Здесь важнее не источник, а однозначность. Всё, что можно понять двумя способами, будет понято вторым: правила проверки разобраны в тексте как устроен хороший вопрос.
Пример из практики, который я привожу всем, кто спрашивает про экономию времени. Я попросил модель дать десять вопросов по теме школьного курса и получил безупречный на вид пакет. При проверке выяснилось: в двух вопросах дата смещена, в одном событие приписано не тому человеку, в одном верных ответов оказалось два. Четыре ошибки на десять вопросов — и ни одна из них не была видна по тексту. Именно поэтому проверка занимает у меня больше времени, чем генерация, и именно поэтому она не сокращается.
Отдельная ловушка — вопросы «на удивление». Модель хорошо генерирует эффектные утверждения вроде «мало кто знает, что...», и почти все они при проверке рассыпаются либо оказываются городской легендой. Я взял за правило: чем красивее звучит факт из нейросети, тем дольше его проверяю.
Нейросеть в разработке платформы
Здесь польза больше и риск меньше, потому что код либо работает, либо нет. Я использую модель для рутинной вёрстки экранов, для типовых кусков логики, для генерации тестовых данных и для быстрых прототипов интерфейса, которые не жалко выбросить. Экономия времени на этих задачах измеряется днями.
Но и здесь есть граница. Архитектурные решения, всё, что связано с приватностью данных, и всё, что определяет поведение системы на площадке без интернета, я делаю сам. Модель охотно предложит решение, которое выглядит стройно и разваливается при первой нестандартной ситуации, а на мероприятии нестандартная ситуация — это норма. Подробнее про то, как из практики ведущего выросли рабочие сервисы, я написал в тексте как я делаю платформы.
Данные и границы допустимого
Правило простое: в нейросеть не отправляются персональные данные учеников и участников. Ни списков класса, ни фамилий с результатами, ни фотографий, ни рабочих файлов с личной информацией. Обработка персональных данных регулируется 152-ФЗ, и передача их в сторонний сервис ради удобства формулировки — плохая идея независимо от того, насколько удобным кажется инструмент.
Второе правило касается авторства. Сгенерированный текст я не выдаю за чужой и не подписываю чужими именами, а сгенерированное изображение не использую там, где нужна документальная достоверность. Игра — не то место, где стоит выяснять границы допустимого экспериментально.
Три вопроса к любому материалу от нейросети. Могу ли я назвать первоисточник каждой цифры и даты? Может ли вопрос быть понят вторым способом? Что я скажу команде, если окажется, что ответ неверен? Если на третий вопрос нет ответа, материал в игру не идёт.
Есть и третье правило, про которое забывают чаще двух первых: не выдавайте сгенерированный материал за проверенный, если вы его не проверяли. Фраза «вопросы подготовлены с помощью нейросети» никого не отпугнёт, а вот обнаруженная участниками ошибка при уверенном тоне ведущего бьёт по доверию ко всему пакету сразу. Я предпочитаю честную формулировку и проверенный факт, а не наоборот.
Чего нейросеть не умеет
Список короткий и за годы практики почти не изменился.
- Чувствовать зал. Понять, что вот этот вопрос для этой конкретной компании прозвучит обидно, а этот вызовет спор о политике, модель не может.
- Держать темп. Всё, что связано с паузой, скоростью и моментом остановки игры, живёт в ведении, а не в тексте.
- Оценивать смешное. Юмор нейросети узнаваемо гладкий и почти никогда не попадает в аудиторию. Шутки я пишу сам или беру из практики.
- Знать вашу школу и ваш класс. Материал, отсылки, недавние события, внутренние шутки — всё это добавляет только человек, который там был.
- Отвечать за результат. Ответственность за каждый факт в игре несёт ведущий, и на инструмент её переложить нельзя.
В PLACETEACHER библиотека вопросов по предметам и классам собрана и вычитана, а не сгенерирована на лету: вы берёте готовый набор или загружаете свой. Счёт по командам ведётся автоматически, урок собирается за перемену. Демо открывается без регистрации.
Что из этого полезно учителю
Учителю нейросеть закрывает ту же задачу, что и мне: перебор формулировок. Черновик карточек, пять вариантов задания разной сложности, набор неверных вариантов ответа, план внеурочного занятия. Всё это ускоряется в разы. Но проверка остаётся ручной, и время на неё нужно закладывать заранее, иначе экономия превращается в мину замедленного действия на уроке.
И трезвая рамка про эффект: игра с плохо проверенными вопросами хуже обычного опроса, потому что она ещё и закрепляет неверное. Работает частое извлечение из памяти с немедленным разбором — при условии, что разбираемый ответ верен. Что именно подтверждено исследованиями по игровым форматам, разобрано в тексте про доказательства геймификации, а как собрать свой набор вопросов быстро — в разборе конструктора квизов.
Частые вопросы
Можно ли доверять вопросам, сгенерированным нейросетью?
Какие задачи нейросеть закрывает лучше всего?
Как проверять факты быстро?
Можно ли загружать в нейросеть данные учеников?
Заменит ли нейросеть автора игр?
Источники
- Huang L. et al. A Survey on Hallucination in Large Language Models, 2023
- Kalai A.T. et al. Why Language Models Hallucinate, 2025
- Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных»
- Rodriguez M.C. Three Options Are Optimal for Multiple-Choice Items. Educational Measurement: Issues and Practice, 2005
- Rowland C.A. The effect of testing versus restudy on retention. Psychological Bulletin, 2014
В PLACETEACHER уже собраны интерактивы по 17 предметам с 1 по 11 класс. Демо открывается без регистрации.