Зачем сжимать модель
Веса модели по умолчанию хранятся с высокой точностью (16 бит на число), и тогда она занимает очень много видеопамяти. Квантизация уменьшает точность до 8, 5 или 4 бит — модель занимает в 2–4 раза меньше и влезает в доступную карту. Потеря качества при этом на деловых задачах обычно незначительна.
Что означают Q4, Q6, Q8
| Квантизация | Память | Качество |
|---|---|---|
| FP16 (без сжатия) | максимум | эталон, но избыточно |
| Q8 | высокая | практически как эталон |
| Q6 | средняя | очень близко к Q8 |
| Q4 | низкая (вдвое меньше Q8) | на бизнес-задачах разница едва заметна |
Как это связано с видеопамятью
Именно благодаря квантизации модель на 32 млрд параметров помещается в 18–24 ГБ, а не требует 60+ ГБ. Полные ориентиры по памяти — в статье сколько видеопамяти нужно для нейросети, а обзор самих моделей — в статье open-source нейросети 2026.
Где легко ошибиться
- •Слишком сильное сжатие маленькой модели заметно роняет качество — на 7–9B это чувствительнее, чем на 70B,
- •Экономия памяти впритык под модель не оставляет запаса на контекст и пользователей,
- •Точку баланса нельзя брать «по обзорам» — её проверяют на ваших реальных задачах.
Мы подбираем модель и квантизацию под задачу и железо — подробнее на странице AI-сервера.
Частые вопросы
Q4 сильно хуже Q8?
Для большинства деловых задач разница между Q4 и Q8 у крупных моделей едва заметна, зато Q4 занимает вдвое меньше памяти. На сложных рассуждениях и коде более высокая точность может дать небольшой выигрыш. Оптимум подбирается тестом на ваших задачах.
Что такое GGUF?
Это популярный формат хранения квантизованных моделей для локального запуска. В нём модель поставляется в разных степенях сжатия (Q4, Q5, Q6, Q8), из которых вы выбираете под своё железо.
Можно ли запускать без квантизации?
Можно, в полной точности (FP16), но это требует в 2–4 раза больше видеопамяти и почти не даёт выигрыша в качестве на бизнес-задачах. Поэтому в продакшене почти всегда используют квантизацию.