
Эпоха больших языковых моделей (LLM), о которых мы писали в статье «OpenJarvis: фреймворк Stanford для локальных ИИ-агентов» [1], стремительно переходит от простых диалоговых систем к новой парадигме — автономным агентам ИИ. Автономные агенты — это системы искусственного интеллекта, способные самостоятельно планировать, выполнять и адаптировать свои действия для достижения сложных целей в динамичной среде, минимизируя вмешательство человека. Они используют большие языковые модели для понимания задач и взаимодействия с инструментами. Однако их широкое внедрение в корпоративную среду сдерживается фундаментальной проблемой: отсутствием стандартов, отвечающих на вопрос, как оценить ИИ-агентов с учетом специфики реальных бизнес-процессов — долгосрочное планирование, постоянные изменения состояния и строгие протоколы доступа. Чтобы закрыть этот пробел, ServiceNow Research в сотрудничестве с Mila и Universite de Montreal представила EnterpriseOps-Gym. Этот новый бенчмарк...








