Тест Беркли показал, что нейросети проваливают реальные рабочие задачи
Исследователи из Калифорнийского университета в Беркли проверили, насколько современные нейросети готовы выполнять реальную работу вместо человека. Вывод оказался неожиданным. Несмотря на то что мировая индустрия искусственного интеллекта уже привлекла более 1,6 трлн долларов, даже самые сильные модели справляются лишь с небольшой частью профессиональных задач.
Для проверки ученые из Center for Responsible, Decentralized Intelligence создали тест Agents' Last Exam. В него вошло более 1500 заданий из 55 профессий. Авторы исследования хотели проверить не способность моделей отвечать на вопросы, а умение выполнять настоящую работу от начала и до конца.
В список попали разработка программного обеспечения, графический дизайн, сельское хозяйство, морская инженерия, звукорежиссура, общественное здравоохранение и многие другие специальности. Исследователи протестировали несколько коммерческих моделей, среди которых GPT-5.5 от OpenAI, Fable 5 от Anthropic, Composer 2.5 от Cursor и Gemini 3.1 Pro от Google. Для сравнения в исследование включили и две открытые китайские модели.
Лучший результат показала GPT-5.5. Однако даже она решила лишь 24% заданий. Самые сложные задачи не смогла выполнить ни одна модель. Там, где требовались глубокие знания предмета, длительное рассуждение и работа с большим объемом информации, все участники получили 0%. При этом Fable 5 показала примерно такой же результат, как GPT-5.5 и Composer 2.5, хотя стоимость выполнения одного задания у нее оказалась в 4−12 раз выше.
Тест прогнали через несколько закрытых коммерческих систем, среди которых Fable 5 от Anthropic, GPT-5.5 от OpenAI, Composer 2.5 от Cursor и Gemini 3.1 Pro от Google, а также пару открытых китайских моделейНад созданием теста работали более 300 специалистов. Среди них были преподаватели и исследователи Массачусетского технологического института, Гарвардского университета и Стэнфордского университета, а также сотрудники Goldman Sachs, JPMorgan, Morgan Stanley и Adobe. Каждый участник предоставил реальную рабочую задачу, которая когда-то потребовала нескольких дней или даже недель. Вместе с заданиями исследователи получили исходные файлы и программы, в которых выполнялась работа.
Результаты проверяли не люди и не другая нейросеть. Для оценки использовали специальные алгоритмы, которые всегда выдают одинаковый результат. Благодаря этому тест оказался намного строже большинства существующих бенчмарков, где современные модели давно показывают почти максимальные оценки.
Разница оказалась особенно заметной при сравнении с популярными тестами. Например, модель на базе GPT-5.5 набирает 82% в бенчмарке Terminal-Bench. Однако в самом сложном разделе Agents' Last Exam она не смогла выполнить ни одного задания. По мнению авторов исследования, это показывает, что высокие места в рейтингах далеко не всегда означают готовность нейросети справляться с настоящими рабочими проектами. Индустрия годами улучшала показатели в тестах, где результат легко измерить, однако такие достижения плохо отражают способность искусственного интеллекта выполнять долгую и сложную профессиональную работу.
Задания для теста собирали больше 300 специалистов из университетов вроде MIT и Стэнфорда, а также из компаний Goldman Sachs, JPMorgan и Adobe, которые принесли собственные реальные проекты вместе с исходными файламиАвторы исследования подчеркивают, что нейросети уже умеют решать большую часть профессиональных задач. Однако проблемы начинаются там, где нужно долго удерживать контекст, опираться на глубокие знания и последовательно доводить проект до конца. По словам соавтора исследования Дон Сон, автоматизация в первую очередь затронет профессии с четкими и повторяющимися процедурами. Там же, где приходится принимать сложные решения и постоянно учитывать меняющиеся обстоятельства, люди еще долго будут сохранять преимущество.
Ранее мы писали о том, что ИИ может уничтожить офисные профессии и устроить крах экономики.
Источник новости: hi-tech.mail.ru

