Исследования · 3 мин

ИИ помогает решить задачу. Помогает ли он научиться?

Полевой эксперимент со школьниками: почему успех с помощником и самостоятельное знание оказались разными результатами.

Что разберём

Полевой эксперимент со школьниками: почему успех с помощником и самостоятельное знание оказались разными результатами.

Две проверки вместо одной

Представь калькулятор на контрольной. С ним можно быстрее получить правильное число, но это ещё не отвечает на вопрос, умеет ли человек считать без него. С генеративным ИИ возникает похожая проблема измерения: оценка готовой работы включает вклад помощника. Чтобы узнать, что освоил ученик, нужна отдельная проверка.

Как устроили исследование

В работе Bastani и соавторов, опубликованной в PNAS в 2025 году, почти тысяча школьников в Турции занималась математикой. Сравнивали обычную практику и два варианта помощника на основе GPT-4. GPT Base позволял свободно обращаться к ИИ. GPT Tutor был настроен на учебную помощь с ограничениями, призванными не подменять работу ученика готовым ответом.

Практика + ИИ→ИИ отключён→Экзамен
В эксперименте отдельно оценивали работу с помощником и самостоятельный результат. Это разные этапы измерения.

Помощь убрали — результат изменился

Во время практики доступ к ИИ улучшал выполнение заданий. Однако после отключения помощника группа GPT Base показала результат хуже контрольной. Вариант GPT Tutor существенно смягчил этот отрицательный эффект. Поэтому судить об обучении только по заданиям, сделанным с ИИ, в этом эксперименте было бы ошибкой.

Откуда берётся цифра 17%

В публикации Wharton о ранней версии работы сообщалось, что самостоятельный результат группы Base оказался на 17% ниже контрольного. Это относительное сравнение результатов конкретного эксперимента, а не потеря 17 процентных пунктов и не утверждение, что человек «стал на 17% глупее». Такие формулировки описывают совсем другие вещи.

Что можно и нельзя заключить

Исследование связывает результат с устройством помощи: важен не только доступ к модели, но и то, как построено взаимодействие с ней. Оно не устанавливает универсальный вред всех нейросетей, не проверяет все предметы и не доказывает эффективность любого чата с просьбой «давай подсказки». Его основной урок для оценки образовательных технологий — различать результат при поддержке инструмента и знания после того, как поддержку убрали.

Источники и дальнейшее чтение