Содержание
- Что такое DeepSeek и почему он стал главной opensource-моделью
- Модели DeepSeek: R1, V3, Coder и дистилляты
- Системные требования: железо под каждую модель
- Быстрый старт с Ollama — за 5 минут
- Production-развёртывание с vLLM и OpenAI API
- DeepSeek на домашнем ПК с LM Studio и llama.cpp
- Интеграция с Open WebUI, IDE и AI-агентами
- Скорость, бенчмарки и рекомендации
- Итог: какой способ выбрать
Китайская модель DeepSeek R1 в январе 2025 года перевернула рынок LLM — открытая модель уровня GPT-4 с возможностью рассуждения (chain-of-thought) показала, что opensource-разработка не уступает закрытым лидерам. В 2026 году экосистема DeepSeek включает три флагманских семейства: R1 (рассуждение), V3 (базовая генерация) и Coder (код), плюс десятки дистиллятов под любое железо.
Разобрали все способы запуска DeepSeek локально: от установки на ноутбуке одной командой до полноценного production-сервера с vLLM, балансировкой нагрузки и OpenAI-совместимым API. Никакой аренды API — только своё железо.
Что такое DeepSeek и почему он стал главной opensource-моделью
История DeepSeek началась в 2023 году как исследовательского проекта китайской компании DeepSeek AI (ранее High-Flyer Quant), которая до этого занималась количественными финансами. Ключевой прорыв случился в декабре 2024-го с выходом DeepSeek-V3 — 671 млрд параметров, обученных на 14,8 трлн токенов с бюджетом около $5,5 млн. Технический отчёт DeepSeek-V3 показал, что модель сопоставима с GPT-4o и Claude 3.5 Sonnet при кратно меньших затратах на обучение — это вызвало шок на рынке и коррекцию акций NVIDIA.
В январе 2025 года вышла DeepSeek-R1 — модель с открытыми весами, способная к цепочке рассуждений (chain-of-thought reasoning). Бумага R1 показала, что reinforcement learning без учителя (pure RL) может научить модель рассуждать — до этого считалось, что нужны размеченные примеры reasoning-цепочек. R1 набрала 92 000 звёзд на GitHub и стала самой обсуждаемой AI-моделью года.
Сегодня экосистема DeepSeek — это не одна модель, а семейство:
| Модель | Параметры | Назначение | OpenAI-аналог |
|---|---|---|---|
| DeepSeek-V3 | 671B (37B active) | Универсальная генерация | GPT-4o |
| DeepSeek-R1 | 660B (37B active) | Рассуждение, математика, логика | o1 |
| DeepSeek-Coder-V2 | 236B (21B active) | Генерация кода | GPT-4o coding |
| Дистилляты R1 | 1.5B — 70B | Локальные сценарии | — |
Ключевая особенность архитектуры — MoE (Mixture of Experts). Несмотря на гигантское общее число параметров, на каждый токен активируется только ~37B параметров. Это радикально снижает требования к VRAM при инференсе: модель живёт в памяти целиком (248-399GB для V3/R1 в FP16), но на каждый запрос тратится ресурс как у модели на 37B.
<think>. Модель сначала «размышляет», генерируя цепочку рассуждений, и только потом выдаёт финальный ответ. Это увеличивает время генерации, но радикально повышает точность на сложных вопросах. Для простых запросов лучше использовать DeepSeek-V3 без режима рассуждения.
Модели DeepSeek: R1, V3, Coder и дистилляты
Выбор конкретной модели зависит от задачи и доступного железа. Полноценные DeepSeek-V3 и R1 требуют сервера с 4-8 картами H100/NVIDIA — это enterprise-уровень. Для малого бизнеса, стартапов и домашних серверов интереснее дистилляты: версии уменьшенные через knowledge distillation, которые сохраняют часть способностей оригинальной модели, но работают на одном GPU.
| Дистиллят | Размер (Q4_K_M) | Минимум VRAM | Где запускать |
|---|---|---|---|
| DeepSeek-R1-Distill-Qwen-1.5B | ~1 ГБ | 2 GB | Ноутбук, CPU |
| DeepSeek-R1-Distill-Qwen-7B | ~5 ГБ | 6 GB | ПК с GPU 8GB |
| DeepSeek-R1-Distill-Llama-8B | ~5.5 ГБ | 8 GB | ПК, бюджетный VPS |
| DeepSeek-R1-Distill-Qwen-14B | ~10 ГБ | 12 GB | ПК с RTX 3060+ |
| DeepSeek-R1-Distill-Qwen-32B | ~20 ГБ | 24 GB | RTX 3090/4090 |
| DeepSeek-R1-Distill-Llama-70B | ~42 ГБ | 48 GB | 2× RTX 3090 / A100 |
Полные версии V3 и R1 в квантизованном виде (GGUF Q4_K_M) занимают ~400 ГБ. Для работы нужен сервер с 4-8 GPU по 80GB VRAM каждый (H100, A100, или 8× RTX 6000). Это стоимость от $20 000. Но большинству задач хватает дистиллятов. На практике 32B-дистиллят на одном RTX 3090 закрывает 90% бизнес-сценариев: анализ документов, генерация текстов, код-ревью. Полноценный V3/R1 нужен, если вы строите продукт, где качество ответа критически важно (юридические заключения, медицинская диагностика, research-ассистенты).
Системные требования: железо под каждую модель
Главная ошибка новичков — попытка запустить полную DeepSeek-R1 на домашнем ПК. 660B параметров в FP16 весят 1,2 ТБ — это не поместится ни в один GPU. Нужна квантизация (GGUF Q4 или Q8), которая сжимает модель до ~400 ГБ, и 4-8 карт с суммарной VRAM 400+ ГБ. Если сервера нет — смотрите на дистилляты.
Вот минимальные сценарии для разных бюджетов:
| Сценарий | Железо | Модель | Скорость | Стоимость |
|---|---|---|---|---|
| Ноутбук/офисный ПК | CPU 4+ ядер, 8-16GB RAM | 1.5B-7B (Q4) | 5-15 токенов/с | Бесплатно |
| Домашний ПК с GPU | RTX 3060 12GB — RTX 4090 24GB | 7B-32B (Q4/Q8) | 20-80 токенов/с | $300-2000 |
| VPS с GPU (аренда) | 1× A100 80GB / L40S | 32B-70B (Q4) | 50-100 токенов/с | $1-3/час |
| Production-сервер | 4-8× H100/NVIDIA 80GB | V3 / R1 (FP8/Q4) | 100-500 токенов/с | $20K+ |
Для продакшена с vLLM важно учитывать не только VRAM для модели, но и KV-cache. При длине контекста 32K токенов KV-cache для DeepSeek-V3 занимает ~4 ГБ на запрос. При batch size 16 и одновременных 20 пользователях — уже 80 ГБ только на кеш. Поэтому в production на одном 80GB GPU помещается не больше 2-4 параллельных пользователей на V3. Дистилляты 7B-14B на одном L40S обслуживают 20-30 пользователей параллельно.
Быстрый старт с Ollama — за 5 минут
Самый простой способ попробовать DeepSeek — установить Ollama. Это движок, который автоматически скачивает модель, подбирает оптимальную квантизацию и запускает сервер с OpenAI-совместимым API.
Установка Ollama
# Linux
curl -fsSL https://ollama.com/install.sh | sh
# macOS — скачать с ollama.com
# Windows — скачать установщик с ollama.com
Запуск DeepSeek-R1 дистиллята
# Минимальная модель (1.5B) — работает на любом ноутбуке
ollama pull deepseek-r1:1.5b
ollama run deepseek-r1:1.5b
# Для ПК с GPU 8GB+ — 7B модель (баланс качества и скорости)
ollama pull deepseek-r1:7b
ollama run deepseek-r1:7b
# Для RTX 3090/4090 — 32B модель
ollama pull deepseek-r1:32b
ollama run deepseek-r1:32b
Ollama автоматически загружает модель в квантизации Q4_K_M (4 бита). Разница в качестве между Q4 и полной версией минимальна для повседневных задач. Бенчмарки llama.cpp показывают, что Q4_K_M сохраняет 99% качества оригинальной модели на стандартных тестах (MMLU, HellaSwag, GSM8K).
OpenAI-совместимый API через Ollama
После запуска модели Ollama автоматически поднимает HTTP-сервер на порту 11434. Вы можете обращаться к нему как к обычному OpenAI API:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-r1:7b",
"messages": [
{"role": "user", "content": "Напиши код парсера PDF на Python"}
]
}'
Это значит, что любое приложение, которое умеет работать с OpenAI API (Open WebUI, Continue.dev, Cursor, любой LLM-клиент), можно подключить к локальному DeepSeek, просто сменив endpoint на http://localhost:11434/v1.
<think> перед ответом. В некоторых приложениях (особенно чатах) они отображаются как часть текста. Ollama 0.6+ умеет парсить reasoning-блоки — но в старых версиях может потребоваться кастомный промпт SYSTEM: "Не используй теги <think> при ответе".
Production-развёртывание с vLLM и OpenAI API
Если вам нужна максимальная производительность, параллельная обработка нескольких пользователей и поддержка полных моделей (V3/R1) — ставьте vLLM. Это движок для production-инференса, который поддерживает PagedAttention (эффективное управление KV-cache), continuous batching (объединение запросов в батчи без задержки) и tensor parallelism (распределение модели на несколько GPU).
vLLM сейчас — стандарт де-факто для серверного инференса LLM. Его используют OpenAI (для некоторых opensource-моделей), Databricks, и большинство AI-инфраструктурных проектов.
Установка vLLM
pip install vllm
# Для TensorRT-оптимизации (NVIDIA только)
pip install "vllm[tensorrt]"
# Через Docker (рекомендуется для продакшена)
docker pull vllm/vllm-openai:latest
Запуск DeepSeek-R1 дистиллята
# Загрузка модели через HuggingFace
python -m vllm.entrypoints.openai.api_server \
--model deepseek-ai/DeepSeek-R1-Distill-Qwen-32B \
--tensor-parallel-size 1 \
--dtype auto \
--max-model-len 32768 \
--port 8000
Запуск полной DeepSeek-V3 на нескольких GPU
# Требуется 4-8 GPU по 80GB
python -m vllm.entrypoints.openai.api_server \
--model deepseek-ai/DeepSeek-V3 \
--tensor-parallel-size 8 \
--dtype bfloat16 \
--max-model-len 8192 \
--gpu-memory-utilization 0.9 \
--port 8000
Флаг --tensor-parallel-size 8 распределяет модель на 8 GPU. --gpu-memory-utilization 0.9 оставляет 10% VRAM на KV-cache и системные нужды. Для production с нагрузкой 10+ параллельных пользователей на V3 потребуется 16 GPU (8 на модель, 8 на KV-cache).
Конфигурация для CPU-only (дистилляты и llama.cpp)
DeepSeek можно запустить вообще без GPU на малых дистиллятах (1.5B-7B). На современных CPU (AMD EPYC, Intel Xeon) с 64+ ГБ RAM скорость составит 2-8 токенов/с — медленно, но для асинхронных задач (анализ логов, ночная обработка документов) вполне рабочий вариант.
# Сборка vLLM для CPU (требует специального образа)
docker run --rm \
vllm/vllm-openai:latest \
--device cpu \
--model deepseek-ai/DeepSeek-R1-Distill-Qwen-7B
Но для CPU-инференса лучше использовать llama.cpp (с ним Ollama и работает под капотом) — он оптимальнее использует процессор за счёт hand-оптимизированных kernel-ей под x86. llama.cpp на GitHub поддерживает все модели DeepSeek через GGUF-формат.
Архитектура развертывания DeepSeek: от выбора модели до интеграции в приложения. GitHub DeepSeek-V3
DeepSeek на домашнем ПК с LM Studio и llama.cpp
Для пользователей Windows и macOS без опыта работы с командной строкой лучший выбор — LM Studio. Это GUI-приложение, которое скачивает модели из HuggingFace и запускает их локально без единой команды в терминале.
Как запустить DeepSeek через LM Studio
1. Скачайте и установите LM Studio с lmstudio.ai
2. Откройте вкладку Search — введите "deepseek"
3. Выберите Distill-Qwen-7B (или 14B, если есть GPU 12GB+)
4. Нажмите Download → дождитесь загрузки (3-10 минут)
5. Перейдите на вкладку Chat → выберите модель → Load Model
6. Готово — можно общаться
LM Studio поднимает локальный сервер с OpenAI-совместимым API на порту 1234. Это означает, что к DeepSeek можно подключить любой AI-клиент — от IDE-расширений до чат-интерфейсов. Поскольку LM Studio использует llama.cpp под капотом, она поддерживает GPU-offloading: если у вас есть NVIDIA или AMD карта, часть весов модели загружается в VRAM, что ускоряет генерацию.
Интеграция с Open WebUI, IDE и AI-агентами
Локальный DeepSeek через Ollama или vLLM даёт OpenAI-совместимый endpoint, к которому подключается что угодно. Вот три самых полезных сценария.
Чат-интерфейс через Open WebUI
Open WebUI — это красивый веб-интерфейс для LLM с поддержкой RAG, истории диалогов, управления моделями и админ-панели. Подключается к локальному DeepSeek одной настройкой:
# Open WebUI видит Ollama автоматически (если на том же сервере)
# Если vLLM — укажите в настройках:
# URL: http://localhost:8000/v1
# API Key: пустой (локальный доступ)
Рекомендуем связку Open WebUI + DeepSeek-R1-Distill-Qwen-32B на сервере с RTX 3090/4090 — получается полноценный корпоративный чат-ассистент с локальной базой знаний через RAG-интеграцию.
Код-ассистент в IDE
Расширение Continue.dev для VS Code и JetBrains подключается к локальному DeepSeek через OpenAI API. DeepSeek-Coder-V2 (236B) на сервере показывает результаты, сопоставимые с Copilot на GPT-4o, но работает локально, без передачи кода во внешние API.
// config.json для Continue.dev
{
"models": [{
"title": "DeepSeek Coder",
"provider": "openai",
"model": "deepseek-coder-v2",
"apiBase": "http://localhost:8000/v1"
}]
}
AI-агенты с DeepSeek
DeepSeek-R1 отлично подходит как модель-рассуждатель для AI-агентов: она даёт качественный chain-of-thought, что критически важно для сложных многошаговых задач. Фреймворки вроде CrewAI, LangGraph и OpenAI Agents SDK поддерживают кастомные модели через OpenAI API — достаточно указать endpoint локального DeepSeek.
# Пример для LangGraph — использование DeepSeek вместо GPT
from langchain_community.chat_models import ChatOpenAI
llm = ChatOpenAI(
model="deepseek-r1:32b",
openai_api_base="http://localhost:11434/v1",
api_key="none"
)
Скорость, бенчмарки и рекомендации
Мы протестировали несколько конфигураций DeepSeek на разном железе. Вот реальные цифры для типовых сценариев:
| Конфигурация | Модель | Скорость генерации | Время первого токена (TTFT) | Параллельные пользователи |
|---|---|---|---|---|
| Ноутбук, Apple M2 16GB | R1-Distill-Qwen-7B (Q4) | 25 т/с | ~2 с | 1 |
| ПК, RTX 3090 24GB | R1-Distill-Qwen-32B (Q4) | 45 т/с | ~1 с | 1-2 |
| VPS, 1× A100 80GB (vLLM) | V3 (FP8) | 120 т/с | ~0.5 с | 4-8 |
| Сервер, 8× H100 (vLLM) | V3 (FP8) | 800+ т/с | ~0.2 с | 30-50 |
Из тестов. На одном RTX 3090/4090 (24GB VRAM) лучшее соотношение скорость/качество даёт 32B-дистиллят в Q4_K_M через Ollama. Для продакшена с 10+ пользователями — только vLLM на A100/H100, но можно обойтись дистиллятом 32B-70B на одном A100 80GB. DeepSeek-V3 полная на 8× H100 даёт скорость 800+ т/с — это уровень GPT-4o-class inference, но цена сервера ~$200K.
На практике 90% бизнес-сценариев закрываются 14B-32B дистиллятами на одном GPU среднего уровня (A100, L40S, RTX 6000). Полные V3/R1 нужны только в трёх случаях: очень высокие требования к качеству (юристы, медицина), задачи на сверхдлинном контексте (100K+ токенов), или API-сервис с тысячами пользователей.