
Команда Alibaba Qwen вновь меняет ландшафт открытых больших языковых моделей, представив новейшее поколение — Qwen3.5. Флагманская модель, Qwen3.5-397B-A17B, демонстрирует революционный подход к балансу между масштабом и эффективностью. Она сочетает в себе колоссальные 397 миллиардов общих параметров, однако благодаря архитектуре Mixture-of-Experts (MoE) активирует всего 17 миллиардов из них для обработки каждого токена. MoE — это архитектура нейронной сети, которая использует множество небольших подсетей (экспертов), где для решения конкретной задачи задействуется лишь их небольшое подмножество, что кардинально повышает скорость работы и снижает вычислительные затраты. Новая модель является нативной визуально-языковой системой, изначально спроектированной для создания нового поколения AI-агентов. Ее возможности впечатляют: контекстное окно до 1 миллиона токенов и поддержка 201 языка, что открывает беспрецедентные горизонты для разработки сложных интеллектуальных систем. Архитектурный прорыв: что...








