GGUF — формат llama.cpp и Ollama, работает на CPU и GPU, качество 95-99% от FP16. AWQ — формат для vLLM, GPU-only, лучшее качество среди 4-bit (96-98%). GPTQ — старый стандарт для text-generation-webui, GPU-only, ~95% качества. Выбор формата определяет, на каком оборудовании вы сможете запустить модель и с какой скоростью.

Квантизация — единственный способ запустить современную LLM на железе, которое у вас уже есть. Без квантизации Llama 3.1 8B требует 16 ГБ VRAM — это RTX 4080 или дороже. С 4-битной квантизацией та же модель занимает ~5 ГБ и работает на RTX 3060, MacBook M1 или даже на CPU.

В 2026 году три формата делят рынок: GGUF (экосистема llama.cpp и Ollama), AWQ (vLLM, TGI, HF Transformers) и GPTQ (AutoGPTQ, text-generation-webui). Каждый формат — это компромисс между скоростью, качеством и совместимостью с железом. Разберёмся, какой подходит именно вам.

3x Сжатие модели 4-bit
~95% Качество на Q4_K_M
57x Разрыв вычисления / память
~400 Токен/с на Q4_K_M

Что такое квантизация LLM и зачем она нужна

Нейросеть состоит из миллионов параметров — весов, которые хранятся как 16-битные числа с плавающей точкой (FP16 или BF16). Каждый параметр — 2 байта. Модель на 8 миллиардов параметров занимает 16 ГБ. Добавьте KV-кэш, overhead и буферы — и вы уже за пределами consumer GPU.

Квантизация — это округление 16-битных чисел до 4 (или 8, 6, 2) бит. Вместо 16 ГБ вы получаете ~5 ГБ. Потери качества — около 5% для 4-битного формата. Часто это незаметно глазом: исследования показывают, что разница между 4-битной квантизацией и FP16 на бенчмарках MMLU составляет 1-3 процентных пункта.

Почему квантизация даёт ускорение? Инференс LLM упирается в пропускную способность памяти, а не в вычисления. RTX 5090 может выполнять ~103 ТБ/с операций, но VRAM выдаёт только 1,8 ТБ/с — разрыв в 57 раз. Квантизация уменьшает объём данных, которые нужно прочитать из памяти на каждый токен, и пропорционально ускоряет генерацию.

GGUF: универсальный формат для CPU и GPU

GGUF (GPT-Generated Unified Format) — наследник GGML, созданный командой llama.cpp. Это самый распространённый формат: все модели на Ollama и в библиотеке TheBloke на Hugging Face — это GGUF.

Главная особенность GGUF — гибридная работа CPU + GPU. В отличие от AWQ и GPTQ, GGUF не требует мощной видеокарты: можно загрузить часть слоёв на GPU, остальные — на CPU. На MacBook с Apple Silicon GGUF использует Metal API и работает практически как на дискретной видеокарте.

Внутри GGUF — это не один формат, а семейство подформатов K-quant, которые подбирают разную битность для разных слоёв сети:

ПодформатБитностьКачество (%)Когда использовать
Q8_08-bit99,5%Если есть VRAM в запасе
Q6_K6-bit~98%Сладкая точка для продакшена
Q5_K_M5-bit96-97%Сбалансированный вариант
Q4_K_M4-bit~95%Стандарт Ollama, минимум VRAM
Q3_K_M3-bit~90%Когда VRAM критически мало
IQ2_M2-bit~85%Экспериментальный, для CPU-only

На практике Q4_K_M — де-факто стандарт для Ollama. Модель 8B (~5 ГБ на диске) легко помещается на GPU с 8 ГБ VRAM (RTX 3060, RTX 4060) и даёт ~200-400 токенов/с на современных consumer GPU. Q6_K — выбор для production, где качество важнее скорости.

Где брать GGUF-модели: Hugging Face (фильтр GGUF) или через ollama pull — Ollama автоматически скачивает Q4_K_M.

AWQ: высокая скорость на GPU с минимальной потерей качества

AWQ (Activation-Aware Weight Quantization) — молодой формат от MIT и Yandex Research (2024), который за два года обогнал GPTQ по популярности. В основе — идея: не все веса одинаково важны. 1% наиболее «влиятельных» весов (по активациям на калибровочных данных) остаются в FP16, остальные — квантизуются до INT4.

Результат: качество 96-98% от FP16 — лучше, чем у GGUF Q4_K_M и GPTQ. При этом скорость инференса на GPU выше, чем у GPTQ — AWQ показывает +50-100% throughput по сравнению с FP16 на vLLM.

AWQ поддерживается основными production-фреймворками: vLLM (через --quantization awq), Hugging Face TGI, и частично — TensorRT-LLM. Для запуска нужна NVIDIA GPU с CUDA — CPU-режима нет.

Где брать AWQ-модели: Hugging Face, фильтр по тегу "awq".

GPTQ: проверенный временем GPU-формат

GPTQ (GPT Post-Training Quantization) — пионер среди квантизационных методов. Опубликован в работе Yann LeCun и команды Meta (2023). Первый формат, который сделал квантизацию практичной: на тот момент GPTQ позволял запустить LLaMA-30B на одной RTX 3090 24 ГБ.

В отличие от AWQ, GPTQ использует оптимальный подход на основе матрицы Гессе — оценивает, как изменение каждого веса влияет на функцию потерь, и подбирает квантизационные группы так, чтобы минимизировать ошибку. Это дороже в расчёте, чем AWQ, но даёт стабильные результаты ~95% качества.

Основная среда — AutoGPTQ и text-generation-webui (oobabooga). GPTQ поддерживается в vLLM (через gptq бэкенд), но уступает AWQ по производительности на тех же GPU.

Сегодня GPTQ — третий по популярности формат. Его место — legacy-системы и проекты, которые обновляются с 2024 года и не перешли на AWQ. Для новых проектов разумнее брать AWQ.

Сравнительная таблица: GGUF vs AWQ vs GPTQ

ХарактеристикаGGUF (Q4_K_M)AWQ (4-bit)GPTQ (4-bit)
ОборудованиеCPU, GPU (гибрид), Apple SiliconNVIDIA GPU (CUDA)NVIDIA GPU (CUDA)
Качество vs FP16~95%96-98%~95%
VRAM (7B модель)4-5 ГБ3,5-4,2 ГБ4-5 ГБ
VRAM (70B модель)40-45 ГБ35-42 ГБ40-45 ГБ
ИнструментыOllama, LM Studio, llama.cppvLLM, TGI, HF TransformersAutoGPTQ, text-gen-webui
Скорость200-400 ток/с (GPU), 10-30 (CPU)250-500 ток/с (GPU)150-350 ток/с (GPU)
Квантизация моделиllama-quantizeAutoAWQAutoGPTQ

Важно: скорость зависит от GPU. Цифры выше — для RTX 4090 / consumer GPU с 24 ГБ. На RTX 3090, A100, H100 скорость будет другой, но соотношение форматов сохраняется: AWQ быстрее GPTQ, GGUF на GPU — между ними.

Какой формат выбрать под свою задачу

У вас только CPU или MacBook

Выбор однозначный — GGUF. Только он работает на CPU и Apple Silicon. Установите Ollama одной командой и запускайте модели через ollama pull deepseek-r1:7b. На MacBook M1-M4 скорость будет сравнима с бюджетной видеокартой.

У вас consumer GPU (8-16 ГБ VRAM)

Для домашнего использования — GGUF (Ollama) или AWQ (vLLM). GGUF проще: скачали Ollama, запустили ollama run. AWQ быстрее, если вы готовы настроить vLLM-сервер. GPTQ — только если пользуетесь text-generation-webui и не хотите менять инструмент.

Вы строите production-сервис на VPS

AWQ — лучший выбор для продакшена. Лучшее качество среди 4-битных форматов, нативная поддержка в vLLM (PagedAttention, continuous batching), выше throughput. Если GPU мощный (H100, A100) — можно использовать FP8 для максимального качества.

У вас несколько серверов с разным железом

Самый гибкий вариант — GGUF с llama.cpp. Одна и та же модель в Q4_K_M работает на CPU (для фоновой обработки) и GPU (для real-time инференса) без пересборки. На разных нодах можно переключать offloading.

Коротко

GGUF — универсальный выбор для любого железа: от Raspberry Pi до сервера с A100. AWQ — наилучшее качество и скорость на GPU для production. GPTQ — устаревший стандарт, который ещё живёт в legacy-проектах, но не рекомендуется для новых разработок. Для домашнего использования — Ollama (GGUF). Для продакшена — vLLM (AWQ). Для максимальной совместимости — llama.cpp (GGUF). Начните с GGUF Q4_K_M на Ollama — это самый короткий путь от идеи до работающего инференса.

Что ещё важно знать

Можно ли использовать GGUF на vLLM?
Нет. GGUF-файлы загружаются только llama.cpp и его обёртками (Ollama, LM Studio). vLLM поддерживает AWQ, GPTQ и FP8. Попытка загрузить GGUF в vLLM вызовет ошибку. И наоборот — AWQ-модель не запустится в Ollama.
Какой формат даёт максимальное качество?
AWQ сохраняет 96-98% качества FP16 — это лучший показатель среди 4-битных форматов. GPTQ даёт ~95%, GGUF Q4_K_M — тоже ~95%, но GGUF позволяет повышать точность: Q6_K (~98%), Q8_0 (~99.5%). Если качество критично — берите AWQ или GGUF Q6_K.
Что такое Q4_K_M в GGUF?
Q4_K_M — сбалансированный подформат GGUF с 4-битной квантизацией (K_M = "K-quant, medium"). На практике — золотая середина между размером и качеством. Есть Q4_K_S (меньше, чуть хуже) и Q4_K_L (чуть лучше, но больше). K_M — стандарт для Ollama.
Какой формат работает на CPU?
Только GGUF. AWQ и GPTQ требуют NVIDIA GPU с CUDA. На CPU GGUF использует ARM NEON или AVX2 для ускорения — медленнее GPU, но работает. MacBook с Apple Silicon (M1-M4) тоже использует GGUF через Metal API.
EXL2 и другие форматы — стоит ли рассматривать?
EXL2 — формат для exllamav2, популярен среди энтузиастов с мощными GPU (RTX 4090). Даёт хорошее качество, но менее распространён. FP8 (NVFP4) — новый стандарт для H100/B200, но требует дорогого оборудования. Для 99% задач хватает GGUF, AWQ или GPTQ.