
Исследователи NVIDIA совершили прорыв в эффективности больших языковых моделей (LLM), представив Jet-Nemotron — семейство гибридных моделей, которые демонстрируют до 53,6 раз более высокую пропускную способность по сравнению с ведущими LLM на основе полного внимания (full-attention). Это достигается при сохранении или даже превышении их точности, что приводит к снижению стоимости инференса на 98%. Ключевая инновация, лежащая в основе этого достижения, — это не создание модели с нуля, а модернизация существующих с помощью техники Post Neural Architecture Search (PostNAS). Проблема скорости и стоимости современных LLM PostNAS: Эффективная модернизация вместо переобучения Производительность Jet-Nemotron в цифрах Новые возможности для бизнеса, IT и науки Проблема скорости и стоимости современных LLM Современные модели, такие как Qwen, Llama и Gemma, установили высокие стандарты точности. Однако их механизм...






