toolcall.
Исследования30 сент. 2026 г., 08:25 UTC

EngiWorld показывает, что AI-агенты пока слабы в инженерном софте

Бенчмарк проверяет CAD, симуляции, производство, BIM, электронику и 3D-задачи; лучший протестированный агент набрал только 44,3 балла.

Новый исследовательский бенчмарк EngiWorld проверяет, могут ли frontier AI-агенты работать в профессиональном инженерном софте, а не только решать отдельные задачи в коде или браузере.

В наборе 1 301 экспертно подготовленная задача по CAD, CAE, CAM, BIM, автоматизации проектирования электроники и 3D-визуализации. Он охватывает 26 профессиональных платформ и включает работу через GUI и командную строку: от выбора подходящего инструмента до открытых дизайн-задач.

Авторы также сделали программные проверяющие системы, которые оценивают геометрическую корректность, физическую реализуемость и соответствие правилам задачи. Это важно: инженерный агент может выглядеть убедительно, но выдать конструкцию, которая на практике не работает.

Главный результат жесткий: среди семи frontier-моделей лучший результат составил 44,3 EngiScore, а успешными оказались только 3,6% попыток, где нужно было использовать несколько программ. Практический вывод: инженерия остается сложным рубежом для AI-агентов. Их уже можно подключать к профессиональным workflow, но статья не поддерживает идею, что им можно доверять автономную end-to-end инженерную работу без контроля человека.

Источники

agentsbenchmarksengineeringresearch