Полевой эксперимент со школьниками: почему успех с помощником и самостоятельное знание оказались разными результатами.
Две проверки вместо одной
Представь калькулятор на контрольной. С ним можно быстрее получить правильное число, но это ещё не отвечает на вопрос, умеет ли человек считать без него. С генеративным ИИ возникает похожая проблема измерения: оценка готовой работы включает вклад помощника. Чтобы узнать, что освоил ученик, нужна отдельная проверка.
Как устроили исследование
В работе Bastani и соавторов, опубликованной в PNAS в 2025 году, почти тысяча школьников в Турции занималась математикой. Сравнивали обычную практику и два варианта помощника на основе GPT-4. GPT Base позволял свободно обращаться к ИИ. GPT Tutor был настроен на учебную помощь с ограничениями, призванными не подменять работу ученика готовым ответом.
Помощь убрали — результат изменился
Во время практики доступ к ИИ улучшал выполнение заданий. Однако после отключения помощника группа GPT Base показала результат хуже контрольной. Вариант GPT Tutor существенно смягчил этот отрицательный эффект. Поэтому судить об обучении только по заданиям, сделанным с ИИ, в этом эксперименте было бы ошибкой.
Откуда берётся цифра 17%
В публикации Wharton о ранней версии работы сообщалось, что самостоятельный результат группы Base оказался на 17% ниже контрольного. Это относительное сравнение результатов конкретного эксперимента, а не потеря 17 процентных пунктов и не утверждение, что человек «стал на 17% глупее». Такие формулировки описывают совсем другие вещи.
Что можно и нельзя заключить
Исследование связывает результат с устройством помощи: важен не только доступ к модели, но и то, как построено взаимодействие с ней. Оно не устанавливает универсальный вред всех нейросетей, не проверяет все предметы и не доказывает эффективность любого чата с просьбой «давай подсказки». Его основной урок для оценки образовательных технологий — различать результат при поддержке инструмента и знания после того, как поддержку убрали.