Содержание
GGUF — формат llama.cpp и Ollama, работает на CPU и GPU, качество 95-99% от FP16. AWQ — формат для vLLM, GPU-only, лучшее качество среди 4-bit (96-98%). GPTQ — старый стандарт для text-generation-webui, GPU-only, ~95% качества. Выбор формата определяет, на каком оборудовании вы сможете запустить модель и с какой скоростью.
Квантизация — единственный способ запустить современную LLM на железе, которое у вас уже есть. Без квантизации Llama 3.1 8B требует 16 ГБ VRAM — это RTX 4080 или дороже. С 4-битной квантизацией та же модель занимает ~5 ГБ и работает на RTX 3060, MacBook M1 или даже на CPU.
В 2026 году три формата делят рынок: GGUF (экосистема llama.cpp и Ollama), AWQ (vLLM, TGI, HF Transformers) и GPTQ (AutoGPTQ, text-generation-webui). Каждый формат — это компромисс между скоростью, качеством и совместимостью с железом. Разберёмся, какой подходит именно вам.
Что такое квантизация LLM и зачем она нужна
Нейросеть состоит из миллионов параметров — весов, которые хранятся как 16-битные числа с плавающей точкой (FP16 или BF16). Каждый параметр — 2 байта. Модель на 8 миллиардов параметров занимает 16 ГБ. Добавьте KV-кэш, overhead и буферы — и вы уже за пределами consumer GPU.
Квантизация — это округление 16-битных чисел до 4 (или 8, 6, 2) бит. Вместо 16 ГБ вы получаете ~5 ГБ. Потери качества — около 5% для 4-битного формата. Часто это незаметно глазом: исследования показывают, что разница между 4-битной квантизацией и FP16 на бенчмарках MMLU составляет 1-3 процентных пункта.
Почему квантизация даёт ускорение? Инференс LLM упирается в пропускную способность памяти, а не в вычисления. RTX 5090 может выполнять ~103 ТБ/с операций, но VRAM выдаёт только 1,8 ТБ/с — разрыв в 57 раз. Квантизация уменьшает объём данных, которые нужно прочитать из памяти на каждый токен, и пропорционально ускоряет генерацию.
GGUF: универсальный формат для CPU и GPU
GGUF (GPT-Generated Unified Format) — наследник GGML, созданный командой llama.cpp. Это самый распространённый формат: все модели на Ollama и в библиотеке TheBloke на Hugging Face — это GGUF.
Главная особенность GGUF — гибридная работа CPU + GPU. В отличие от AWQ и GPTQ, GGUF не требует мощной видеокарты: можно загрузить часть слоёв на GPU, остальные — на CPU. На MacBook с Apple Silicon GGUF использует Metal API и работает практически как на дискретной видеокарте.
Внутри GGUF — это не один формат, а семейство подформатов K-quant, которые подбирают разную битность для разных слоёв сети:
| Подформат | Битность | Качество (%) | Когда использовать |
|---|---|---|---|
| Q8_0 | 8-bit | 99,5% | Если есть VRAM в запасе |
| Q6_K | 6-bit | ~98% | Сладкая точка для продакшена |
| Q5_K_M | 5-bit | 96-97% | Сбалансированный вариант |
| Q4_K_M | 4-bit | ~95% | Стандарт Ollama, минимум VRAM |
| Q3_K_M | 3-bit | ~90% | Когда VRAM критически мало |
| IQ2_M | 2-bit | ~85% | Экспериментальный, для CPU-only |
На практике Q4_K_M — де-факто стандарт для Ollama. Модель 8B (~5 ГБ на диске) легко помещается на GPU с 8 ГБ VRAM (RTX 3060, RTX 4060) и даёт ~200-400 токенов/с на современных consumer GPU. Q6_K — выбор для production, где качество важнее скорости.
Где брать GGUF-модели: Hugging Face (фильтр GGUF) или через ollama pull — Ollama автоматически скачивает Q4_K_M.
AWQ: высокая скорость на GPU с минимальной потерей качества
AWQ (Activation-Aware Weight Quantization) — молодой формат от MIT и Yandex Research (2024), который за два года обогнал GPTQ по популярности. В основе — идея: не все веса одинаково важны. 1% наиболее «влиятельных» весов (по активациям на калибровочных данных) остаются в FP16, остальные — квантизуются до INT4.
Результат: качество 96-98% от FP16 — лучше, чем у GGUF Q4_K_M и GPTQ. При этом скорость инференса на GPU выше, чем у GPTQ — AWQ показывает +50-100% throughput по сравнению с FP16 на vLLM.
AWQ поддерживается основными production-фреймворками: vLLM (через --quantization awq), Hugging Face TGI, и частично — TensorRT-LLM. Для запуска нужна NVIDIA GPU с CUDA — CPU-режима нет.
Где брать AWQ-модели: Hugging Face, фильтр по тегу "awq".
GPTQ: проверенный временем GPU-формат
GPTQ (GPT Post-Training Quantization) — пионер среди квантизационных методов. Опубликован в работе Yann LeCun и команды Meta (2023). Первый формат, который сделал квантизацию практичной: на тот момент GPTQ позволял запустить LLaMA-30B на одной RTX 3090 24 ГБ.
В отличие от AWQ, GPTQ использует оптимальный подход на основе матрицы Гессе — оценивает, как изменение каждого веса влияет на функцию потерь, и подбирает квантизационные группы так, чтобы минимизировать ошибку. Это дороже в расчёте, чем AWQ, но даёт стабильные результаты ~95% качества.
Основная среда — AutoGPTQ и text-generation-webui (oobabooga). GPTQ поддерживается в vLLM (через gptq бэкенд), но уступает AWQ по производительности на тех же GPU.
Сегодня GPTQ — третий по популярности формат. Его место — legacy-системы и проекты, которые обновляются с 2024 года и не перешли на AWQ. Для новых проектов разумнее брать AWQ.
Сравнительная таблица: GGUF vs AWQ vs GPTQ
| Характеристика | GGUF (Q4_K_M) | AWQ (4-bit) | GPTQ (4-bit) |
|---|---|---|---|
| Оборудование | CPU, GPU (гибрид), Apple Silicon | NVIDIA GPU (CUDA) | NVIDIA GPU (CUDA) |
| Качество vs FP16 | ~95% | 96-98% | ~95% |
| VRAM (7B модель) | 4-5 ГБ | 3,5-4,2 ГБ | 4-5 ГБ |
| VRAM (70B модель) | 40-45 ГБ | 35-42 ГБ | 40-45 ГБ |
| Инструменты | Ollama, LM Studio, llama.cpp | vLLM, TGI, HF Transformers | AutoGPTQ, text-gen-webui |
| Скорость | 200-400 ток/с (GPU), 10-30 (CPU) | 250-500 ток/с (GPU) | 150-350 ток/с (GPU) |
| Квантизация модели | llama-quantize | AutoAWQ | AutoGPTQ |
Важно: скорость зависит от GPU. Цифры выше — для RTX 4090 / consumer GPU с 24 ГБ. На RTX 3090, A100, H100 скорость будет другой, но соотношение форматов сохраняется: AWQ быстрее GPTQ, GGUF на GPU — между ними.
Какой формат выбрать под свою задачу
У вас только CPU или MacBook
Выбор однозначный — GGUF. Только он работает на CPU и Apple Silicon. Установите Ollama одной командой и запускайте модели через ollama pull deepseek-r1:7b. На MacBook M1-M4 скорость будет сравнима с бюджетной видеокартой.
У вас consumer GPU (8-16 ГБ VRAM)
Для домашнего использования — GGUF (Ollama) или AWQ (vLLM). GGUF проще: скачали Ollama, запустили ollama run. AWQ быстрее, если вы готовы настроить vLLM-сервер. GPTQ — только если пользуетесь text-generation-webui и не хотите менять инструмент.
Вы строите production-сервис на VPS
AWQ — лучший выбор для продакшена. Лучшее качество среди 4-битных форматов, нативная поддержка в vLLM (PagedAttention, continuous batching), выше throughput. Если GPU мощный (H100, A100) — можно использовать FP8 для максимального качества.
У вас несколько серверов с разным железом
Самый гибкий вариант — GGUF с llama.cpp. Одна и та же модель в Q4_K_M работает на CPU (для фоновой обработки) и GPU (для real-time инференса) без пересборки. На разных нодах можно переключать offloading.
Коротко
GGUF — универсальный выбор для любого железа: от Raspberry Pi до сервера с A100. AWQ — наилучшее качество и скорость на GPU для production. GPTQ — устаревший стандарт, который ещё живёт в legacy-проектах, но не рекомендуется для новых разработок. Для домашнего использования — Ollama (GGUF). Для продакшена — vLLM (AWQ). Для максимальной совместимости — llama.cpp (GGUF). Начните с GGUF Q4_K_M на Ollama — это самый короткий путь от идеи до работающего инференса.