Новый анализ искусственного интеллекта: критика модели Centaur и её недостатки в понимании человеческого мышления

В последние десятилетия в психологии ведутся споры о том, может ли одна общая теория объяснить работу человеческого разума или же внимание, память и принятие решений требуют уникальных моделей. Этот дискуссионный вопрос стал ещё более актуальным после публикации в журнале Nature, где была представлена модель искусственного интеллекта Centaur. Разработанная с использованием больших языковых моделей и данных психологических экспериментов, Centaur заявила о своей способности предсказывать человеческое поведение в рамках 160 когнитивных задач.

Проблемы в понимании модели Centaur

Однако новое исследование группы учёных из Университета Чжэцзян, опубликованное в журнале National Science Open, ставит под сомнение успешность Centaur, указывая на то, что её производительность может не отражать действительного понимания, а скорее быть следствием переобучения. Ученые предполагают, что модель лучше распознавала шаблоны ответов, чем понимала, что именно требовалось от неё в задачах.

Исследование выделяет ключевое различие: когда информация, необходимая для выполнения задания, исчезает, какой результат показывает модель? Для проверки этой гипотезы были созданы три условия тестирования, включая условия, при которых модель лишалась критически важной информации для выполнения поставленных задач.

Методология тестирования и её результаты

В первом условии, названном «без инструкций», убрали полностью инструкции, оставив лишь текст процедуры, описывающий реакции участников. Во втором условии, «без контекста», были удалены как инструкции, так и процедуры. Третье условие включало введение ложной инструкции. Если Centaur действительно понимала задачи, её производительность должна была упасть до уровня случайных ответов, но этого не произошло.

Хотя модель продолжала показывать хорошие результаты в условиях, в которых отсутствовали инструкции, это выдвигает важный вопрос: отражает ли успешность Centaur реальное выполнение заданий или же она просто использует искомые статистические подсказки, заложенные в данных? Исследования показывают, что претенденты на высокие балы не всегда указывают на глубокое понимание материала.

Исторический контекст и критический анализ

Эти результаты вызывают серьёзные сомнения по поводу основного утверждения Centaur как когнитивной модели. Учёные подчеркивают, что её самое большое слабое место связано с пониманием языка, что ставит под вопрос более широкие претензии о её способности имитировать человеческую мысль. Это также подчеркивает необходимость более строгого подхода к оценке подобных моделей.

Одним из главных выводов является то, что для развития более точных когнитивных моделей необходимо включать более сложные оценки. Модели должны проверяться в условиях с изменённой или вводящей в заблуждение информацией. Для разработчиков ИИ это сигнал о возможных ограничениях тонкой настройки языковых моделей.

Практическое значение исследования

Для научного сообщества данное исследование представляет собой напоминание о необходимости более тщательного проектирования оценок моделей, а для общественности – о том, что заголовки о машинах, имитирующих человеческий разум, стоит воспринимать с осторожностью. Высокие баллы не всегда означают глубокое понимание.

Таким образом, стремление к созданию унифицированных когнитивных моделей продолжится, однако это исследование показывает, что для достижения прогресса требуется как инновационное мышление, так и скептицизм. Вопросы о природе человеческого мышления продолжают оставаться открытыми, даже для машин, обученных на миллионах слов.

Данные исследования доступны в журнале National Science Open, а оригинальная статья «Новое исследование ставит под сомнение утверждение о том, что ИИ может мыслить как человек» опубликована в The Brighter Side of News.