Исследование показало, что ИИ пока уступает математикам в решении сложных научных задач
Несмотря на быстрый прогресс искусственного интеллекта, современные модели пока не способны на уровне лучших математиков решать сложные исследовательские задачи. Новый тест First Proof показал, что даже передовые ИИ-системы справляются лишь с частью таких заданий.
Современные модели искусственного интеллекта демонстрируют значительный прогресс в обработке естественного языка и написании программного кода, однако пока уступают ведущим математикам в решении сложных научных задач. Об этом пишет WION со ссылкой на результаты исследования в рамках проекта First Proof.
Проект считается одним из наиболее строгих тестов для оценки математических возможностей искусственного интеллекта. Его цель — проверить, способны ли ИИ-системы самостоятельно решать новые задачи исследовательского уровня, которые отсутствовали в их обучающих данных.
В рамках эксперимента четырем передовым ИИ-моделям предложили десять сложных математических задач. Ответы проверяли независимые эксперты-математики, что исключало возможность использования заранее известных решений.
Организаторы подчеркивают, что тест проводился автономно, без участия людей в процессе выполнения заданий. К участию допускались только публично доступные ИИ-системы.
Среди участников были OpenAI с ChatGPT 5.5 Pro, а также академические команды из Калифорнийского университета, Принстонского университета и Швейцарского федерального института технологий в Цюрихе. Они использовали так называемые «хэрнесы» — автоматизированные системы, которые заставляют чат-боты многократно проверять, уточнять и корректировать свои ответы.
Результаты показали, что лучшая система смогла решить только 6 из 10 задач. Поскольку все задания ранее уже были решены профессиональными математиками, это свидетельствует о том, что человеческая экспертиза по-прежнему превосходит ИИ при работе с новыми математическими проблемами исследовательского уровня.
Авторы проекта отмечают, что искусственному интеллекту еще предстоит пройти значительный путь, прежде чем такие системы смогут автономно выступать надежными исследовательскими ассистентами, проверять доказательства и полноценно помогать математикам в решении сложных задач.
Источник: WION