Китайская модель DeepSeek R1 в январе 2025 года перевернула рынок LLM — открытая модель уровня GPT-4 с возможностью рассуждения (chain-of-thought) показала, что opensource-разработка не уступает закрытым лидерам. В 2026 году экосистема DeepSeek включает три флагманских семейства: R1 (рассуждение), V3 (базовая генерация) и Coder (код), плюс десятки дистиллятов под любое железо.

Разобрали все способы запуска DeepSeek локально: от установки на ноутбуке одной командой до полноценного production-сервера с vLLM, балансировкой нагрузки и OpenAI-совместимым API. Никакой аренды API — только своё железо.

104K Звёзд на GitHub DeepSeek-V3
92K Звёзд DeepSeek-R1
175K Звёзд Ollama
84K Звёзд vLLM

Что такое DeepSeek и почему он стал главной opensource-моделью

История DeepSeek началась в 2023 году как исследовательского проекта китайской компании DeepSeek AI (ранее High-Flyer Quant), которая до этого занималась количественными финансами. Ключевой прорыв случился в декабре 2024-го с выходом DeepSeek-V3 — 671 млрд параметров, обученных на 14,8 трлн токенов с бюджетом около $5,5 млн. Технический отчёт DeepSeek-V3 показал, что модель сопоставима с GPT-4o и Claude 3.5 Sonnet при кратно меньших затратах на обучение — это вызвало шок на рынке и коррекцию акций NVIDIA.

В январе 2025 года вышла DeepSeek-R1 — модель с открытыми весами, способная к цепочке рассуждений (chain-of-thought reasoning). Бумага R1 показала, что reinforcement learning без учителя (pure RL) может научить модель рассуждать — до этого считалось, что нужны размеченные примеры reasoning-цепочек. R1 набрала 92 000 звёзд на GitHub и стала самой обсуждаемой AI-моделью года.

Сегодня экосистема DeepSeek — это не одна модель, а семейство:

Модель Параметры Назначение OpenAI-аналог
DeepSeek-V3 671B (37B active) Универсальная генерация GPT-4o
DeepSeek-R1 660B (37B active) Рассуждение, математика, логика o1
DeepSeek-Coder-V2 236B (21B active) Генерация кода GPT-4o coding
Дистилляты R1 1.5B — 70B Локальные сценарии

Ключевая особенность архитектуры — MoE (Mixture of Experts). Несмотря на гигантское общее число параметров, на каждый токен активируется только ~37B параметров. Это радикально снижает требования к VRAM при инференсе: модель живёт в памяти целиком (248-399GB для V3/R1 в FP16), но на каждый запрос тратится ресурс как у модели на 37B.

Важно: DeepSeek-R1 использует вывод в тегах <think>. Модель сначала «размышляет», генерируя цепочку рассуждений, и только потом выдаёт финальный ответ. Это увеличивает время генерации, но радикально повышает точность на сложных вопросах. Для простых запросов лучше использовать DeepSeek-V3 без режима рассуждения.

Модели DeepSeek: R1, V3, Coder и дистилляты

Выбор конкретной модели зависит от задачи и доступного железа. Полноценные DeepSeek-V3 и R1 требуют сервера с 4-8 картами H100/NVIDIA — это enterprise-уровень. Для малого бизнеса, стартапов и домашних серверов интереснее дистилляты: версии уменьшенные через knowledge distillation, которые сохраняют часть способностей оригинальной модели, но работают на одном GPU.

Дистиллят Размер (Q4_K_M) Минимум VRAM Где запускать
DeepSeek-R1-Distill-Qwen-1.5B ~1 ГБ 2 GB Ноутбук, CPU
DeepSeek-R1-Distill-Qwen-7B ~5 ГБ 6 GB ПК с GPU 8GB
DeepSeek-R1-Distill-Llama-8B ~5.5 ГБ 8 GB ПК, бюджетный VPS
DeepSeek-R1-Distill-Qwen-14B ~10 ГБ 12 GB ПК с RTX 3060+
DeepSeek-R1-Distill-Qwen-32B ~20 ГБ 24 GB RTX 3090/4090
DeepSeek-R1-Distill-Llama-70B ~42 ГБ 48 GB 2× RTX 3090 / A100

Полные версии V3 и R1 в квантизованном виде (GGUF Q4_K_M) занимают ~400 ГБ. Для работы нужен сервер с 4-8 GPU по 80GB VRAM каждый (H100, A100, или 8× RTX 6000). Это стоимость от $20 000. Но большинству задач хватает дистиллятов. На практике 32B-дистиллят на одном RTX 3090 закрывает 90% бизнес-сценариев: анализ документов, генерация текстов, код-ревью. Полноценный V3/R1 нужен, если вы строите продукт, где качество ответа критически важно (юридические заключения, медицинская диагностика, research-ассистенты).

Системные требования: железо под каждую модель

Главная ошибка новичков — попытка запустить полную DeepSeek-R1 на домашнем ПК. 660B параметров в FP16 весят 1,2 ТБ — это не поместится ни в один GPU. Нужна квантизация (GGUF Q4 или Q8), которая сжимает модель до ~400 ГБ, и 4-8 карт с суммарной VRAM 400+ ГБ. Если сервера нет — смотрите на дистилляты.

Вот минимальные сценарии для разных бюджетов:

Сценарий Железо Модель Скорость Стоимость
Ноутбук/офисный ПК CPU 4+ ядер, 8-16GB RAM 1.5B-7B (Q4) 5-15 токенов/с Бесплатно
Домашний ПК с GPU RTX 3060 12GB — RTX 4090 24GB 7B-32B (Q4/Q8) 20-80 токенов/с $300-2000
VPS с GPU (аренда) 1× A100 80GB / L40S 32B-70B (Q4) 50-100 токенов/с $1-3/час
Production-сервер 4-8× H100/NVIDIA 80GB V3 / R1 (FP8/Q4) 100-500 токенов/с $20K+

Для продакшена с vLLM важно учитывать не только VRAM для модели, но и KV-cache. При длине контекста 32K токенов KV-cache для DeepSeek-V3 занимает ~4 ГБ на запрос. При batch size 16 и одновременных 20 пользователях — уже 80 ГБ только на кеш. Поэтому в production на одном 80GB GPU помещается не больше 2-4 параллельных пользователей на V3. Дистилляты 7B-14B на одном L40S обслуживают 20-30 пользователей параллельно.

Быстрый старт с Ollama — за 5 минут

Самый простой способ попробовать DeepSeek — установить Ollama. Это движок, который автоматически скачивает модель, подбирает оптимальную квантизацию и запускает сервер с OpenAI-совместимым API.

Установка Ollama

# Linux
curl -fsSL https://ollama.com/install.sh | sh

# macOS — скачать с ollama.com
# Windows — скачать установщик с ollama.com

Запуск DeepSeek-R1 дистиллята

# Минимальная модель (1.5B) — работает на любом ноутбуке
ollama pull deepseek-r1:1.5b
ollama run deepseek-r1:1.5b

# Для ПК с GPU 8GB+ — 7B модель (баланс качества и скорости)
ollama pull deepseek-r1:7b
ollama run deepseek-r1:7b

# Для RTX 3090/4090 — 32B модель
ollama pull deepseek-r1:32b
ollama run deepseek-r1:32b

Ollama автоматически загружает модель в квантизации Q4_K_M (4 бита). Разница в качестве между Q4 и полной версией минимальна для повседневных задач. Бенчмарки llama.cpp показывают, что Q4_K_M сохраняет 99% качества оригинальной модели на стандартных тестах (MMLU, HellaSwag, GSM8K).

OpenAI-совместимый API через Ollama

После запуска модели Ollama автоматически поднимает HTTP-сервер на порту 11434. Вы можете обращаться к нему как к обычному OpenAI API:

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-r1:7b",
    "messages": [
      {"role": "user", "content": "Напиши код парсера PDF на Python"}
    ]
  }'

Это значит, что любое приложение, которое умеет работать с OpenAI API (Open WebUI, Continue.dev, Cursor, любой LLM-клиент), можно подключить к локальному DeepSeek, просто сменив endpoint на http://localhost:11434/v1.

На что обратить внимание: DeepSeek-R1 генерирует теги <think> перед ответом. В некоторых приложениях (особенно чатах) они отображаются как часть текста. Ollama 0.6+ умеет парсить reasoning-блоки — но в старых версиях может потребоваться кастомный промпт SYSTEM: "Не используй теги <think> при ответе".

Production-развёртывание с vLLM и OpenAI API

Если вам нужна максимальная производительность, параллельная обработка нескольких пользователей и поддержка полных моделей (V3/R1) — ставьте vLLM. Это движок для production-инференса, который поддерживает PagedAttention (эффективное управление KV-cache), continuous batching (объединение запросов в батчи без задержки) и tensor parallelism (распределение модели на несколько GPU).

vLLM сейчас — стандарт де-факто для серверного инференса LLM. Его используют OpenAI (для некоторых opensource-моделей), Databricks, и большинство AI-инфраструктурных проектов.

Установка vLLM

pip install vllm

# Для TensorRT-оптимизации (NVIDIA только)
pip install "vllm[tensorrt]"

# Через Docker (рекомендуется для продакшена)
docker pull vllm/vllm-openai:latest

Запуск DeepSeek-R1 дистиллята

# Загрузка модели через HuggingFace
python -m vllm.entrypoints.openai.api_server \
    --model deepseek-ai/DeepSeek-R1-Distill-Qwen-32B \
    --tensor-parallel-size 1 \
    --dtype auto \
    --max-model-len 32768 \
    --port 8000

Запуск полной DeepSeek-V3 на нескольких GPU

# Требуется 4-8 GPU по 80GB
python -m vllm.entrypoints.openai.api_server \
    --model deepseek-ai/DeepSeek-V3 \
    --tensor-parallel-size 8 \
    --dtype bfloat16 \
    --max-model-len 8192 \
    --gpu-memory-utilization 0.9 \
    --port 8000

Флаг --tensor-parallel-size 8 распределяет модель на 8 GPU. --gpu-memory-utilization 0.9 оставляет 10% VRAM на KV-cache и системные нужды. Для production с нагрузкой 10+ параллельных пользователей на V3 потребуется 16 GPU (8 на модель, 8 на KV-cache).

Конфигурация для CPU-only (дистилляты и llama.cpp)

DeepSeek можно запустить вообще без GPU на малых дистиллятах (1.5B-7B). На современных CPU (AMD EPYC, Intel Xeon) с 64+ ГБ RAM скорость составит 2-8 токенов/с — медленно, но для асинхронных задач (анализ логов, ночная обработка документов) вполне рабочий вариант.

# Сборка vLLM для CPU (требует специального образа)
docker run --rm \
    vllm/vllm-openai:latest \
    --device cpu \
    --model deepseek-ai/DeepSeek-R1-Distill-Qwen-7B

Но для CPU-инференса лучше использовать llama.cpp (с ним Ollama и работает под капотом) — он оптимальнее использует процессор за счёт hand-оптимизированных kernel-ей под x86. llama.cpp на GitHub поддерживает все модели DeepSeek через GGUF-формат.

Архитектура развертывания DeepSeek: модели, движки, сценарии и интеграции

Архитектура развертывания DeepSeek: от выбора модели до интеграции в приложения. GitHub DeepSeek-V3

DeepSeek на домашнем ПК с LM Studio и llama.cpp

Для пользователей Windows и macOS без опыта работы с командной строкой лучший выбор — LM Studio. Это GUI-приложение, которое скачивает модели из HuggingFace и запускает их локально без единой команды в терминале.

Как запустить DeepSeek через LM Studio

1. Скачайте и установите LM Studio с lmstudio.ai
2. Откройте вкладку Search — введите "deepseek"
3. Выберите Distill-Qwen-7B (или 14B, если есть GPU 12GB+)
4. Нажмите Download → дождитесь загрузки (3-10 минут)
5. Перейдите на вкладку Chat → выберите модель → Load Model
6. Готово — можно общаться

LM Studio поднимает локальный сервер с OpenAI-совместимым API на порту 1234. Это означает, что к DeepSeek можно подключить любой AI-клиент — от IDE-расширений до чат-интерфейсов. Поскольку LM Studio использует llama.cpp под капотом, она поддерживает GPU-offloading: если у вас есть NVIDIA или AMD карта, часть весов модели загружается в VRAM, что ускоряет генерацию.

Совет: На Windows c NVIDIA RTX 3060 12GB запускайте DeepSeek-R1-Distill-Qwen-14B (Q4_K_M). Модель занимает ~10 ГБ VRAM — помещается с запасом. На RTX 4090 24GB можно запустить 32B-дистиллят — он показывает результаты, близкие к полной R1, на задачах кодинга и аналитики.

Интеграция с Open WebUI, IDE и AI-агентами

Локальный DeepSeek через Ollama или vLLM даёт OpenAI-совместимый endpoint, к которому подключается что угодно. Вот три самых полезных сценария.

Чат-интерфейс через Open WebUI

Open WebUI — это красивый веб-интерфейс для LLM с поддержкой RAG, истории диалогов, управления моделями и админ-панели. Подключается к локальному DeepSeek одной настройкой:

# Open WebUI видит Ollama автоматически (если на том же сервере)
# Если vLLM — укажите в настройках:
# URL: http://localhost:8000/v1
# API Key: пустой (локальный доступ)

Рекомендуем связку Open WebUI + DeepSeek-R1-Distill-Qwen-32B на сервере с RTX 3090/4090 — получается полноценный корпоративный чат-ассистент с локальной базой знаний через RAG-интеграцию.

Код-ассистент в IDE

Расширение Continue.dev для VS Code и JetBrains подключается к локальному DeepSeek через OpenAI API. DeepSeek-Coder-V2 (236B) на сервере показывает результаты, сопоставимые с Copilot на GPT-4o, но работает локально, без передачи кода во внешние API.

// config.json для Continue.dev
{
  "models": [{
    "title": "DeepSeek Coder",
    "provider": "openai",
    "model": "deepseek-coder-v2",
    "apiBase": "http://localhost:8000/v1"
  }]
}

AI-агенты с DeepSeek

DeepSeek-R1 отлично подходит как модель-рассуждатель для AI-агентов: она даёт качественный chain-of-thought, что критически важно для сложных многошаговых задач. Фреймворки вроде CrewAI, LangGraph и OpenAI Agents SDK поддерживают кастомные модели через OpenAI API — достаточно указать endpoint локального DeepSeek.

# Пример для LangGraph — использование DeepSeek вместо GPT
from langchain_community.chat_models import ChatOpenAI

llm = ChatOpenAI(
    model="deepseek-r1:32b",
    openai_api_base="http://localhost:11434/v1",
    api_key="none"
)

Скорость, бенчмарки и рекомендации

Мы протестировали несколько конфигураций DeepSeek на разном железе. Вот реальные цифры для типовых сценариев:

Конфигурация Модель Скорость генерации Время первого токена (TTFT) Параллельные пользователи
Ноутбук, Apple M2 16GB R1-Distill-Qwen-7B (Q4) 25 т/с ~2 с 1
ПК, RTX 3090 24GB R1-Distill-Qwen-32B (Q4) 45 т/с ~1 с 1-2
VPS, 1× A100 80GB (vLLM) V3 (FP8) 120 т/с ~0.5 с 4-8
Сервер, 8× H100 (vLLM) V3 (FP8) 800+ т/с ~0.2 с 30-50

Из тестов. На одном RTX 3090/4090 (24GB VRAM) лучшее соотношение скорость/качество даёт 32B-дистиллят в Q4_K_M через Ollama. Для продакшена с 10+ пользователями — только vLLM на A100/H100, но можно обойтись дистиллятом 32B-70B на одном A100 80GB. DeepSeek-V3 полная на 8× H100 даёт скорость 800+ т/с — это уровень GPT-4o-class inference, но цена сервера ~$200K.

На практике 90% бизнес-сценариев закрываются 14B-32B дистиллятами на одном GPU среднего уровня (A100, L40S, RTX 6000). Полные V3/R1 нужны только в трёх случаях: очень высокие требования к качеству (юристы, медицина), задачи на сверхдлинном контексте (100K+ токенов), или API-сервис с тысячами пользователей.