Содержание
- Коротко: что выбрать
- Как устроен голосовой AI-агент
- Pipecat — реальное время и мультимодальность
- LiveKit Agents — масштаб и продакшен
- TEN Framework — визуальный конструктор
- Vocode — библиотека для Python-разработчиков
- Bolna — мультиканальные voice-боты
- Сравнительная таблица
- Как выбрать под свой стек
Голосовые AI-агенты в 2026 году — это не Siri и не Алиса. Это фреймворки, которые в реальном времени превращают звук в осмысленный диалог: Pipecat (13K ★) — лидер по гибкости и поддержке потокового аудио, LiveKit Agents (11K ★) — продакшен-решение от создателей одного из крупнейших WebRTC-движков, TEN Framework (10K ★) — визуальный конструктор с графом нод, Vocode — лёгкая Python-библиотека для быстрого прототипирования, Bolna (680 ★) — мультиканальный бот для телефонии и Telegram.
Как устроен голосовой AI-агент
Прежде чем сравнивать фреймворки, стоит понять общую архитектуру. Голосовой AI-агент — это цепочка из трёх звеньев: Speech-to-Text (STT) → LLM + логика агента → Text-to-Speech (TTS). В реальном времени весь цикл занимает 300–800 мс — меньше, чем пауза в человеческом разговоре.
Типовая архитектура голосового AI-агента: аудиопоток от микрофона проходит через STT, LLM и TTS, оркестрируется фреймворком
Все пять фреймворков реализуют эту схему, но с разными компромиссами. Pipecat и LiveKit заточены под потоковую обработку (режим real-time, где аудиофрагменты обрабатываются по мере поступления). TEN Framework добавляет визуальный граф, в котором нодами можно перетаскивать STT, LLM, TTS и инструменты. Vocode остаётся самой лёгкой библиотекой, а Bolna идёт дальше всех в мультиканальность — голос, Telegram, SIP-телефония.
Выбор TTS и STT остаётся за разработчиком. Все фреймворки поддерживают Whisper (включая Speaches ASR — реализацию whisper.cpp через REST), Kokoro (82M параметров, открытый вес), Cartesia, ElevenLabs. По данным AssemblyAI, в 2026 году рынок voice-оркестрации растёт на 60% в год — основными драйверами стали open-source решения, избавляющие от вендор-лока.
Pipecat — реальное время и мультимодальность
Pipecat — фреймворк от Daily.co, набравший 13K звёзд на GitHub. Его главное отличие от конкурентов — pipeline-архитектура, где каждый этап обработки (захват аудио, STT, LLM, TTS, вывод) оформлен как отдельный frame processor.
Pipecat из коробки поддерживает видео и передачу экрана, а не только голос. Это единственный фреймворк, который позволяет агенту «видеть» происходящее (например, читать код на экране собеседника или распознавать эмоции по лицу). Сериализация транспортного слоя идёт через Daily RTC или WebSockets.
Ключевые возможности: транспортно-независимые процессоры, встроенный VAD (voice activity detection), поддержка Kokoro, ElevenLabs, Cartesia, Azure Speech, Deepgram, Whisper. Есть готовые примеры в документации — от простого echo-бота до агента с RAG и инструментами. Лицензия BSD-2-Clause, что позволяет коммерческое использование без ограничений.
На практике Pipecat выбирают команды, которые хотят полный контроль над пайплайном. Минус — нет визуального интерфейса, всё через код. Зато AWS опубликовала официальный гайд по развёртыванию Pipecat на Bedrock, что говорит об уровне зрелости.
LiveKit Agents — масштаб и продакшен
LiveKit Agents (11K ★) — это фреймворк от команды, создавшей LiveKit Server, один из самых производительных WebRTC-серверов с открытым исходным кодом. Если Pipecat — это «собери сам из процессоров», то LiveKit — «вот тебе готовая платформа, подключай агентов как участников конференции».
Архитектура LiveKit принципиально другая: агент входит в комнату как полноценный участник RTC-сессии. Это означает, что вся работа с аудиопотоками (микширование, запись, переключение между участниками) ложится на LiveKit Server, а не на код агента. Разработчик пишет только логику обработки — STT → LLM → TTS.
LiveKit поддерживает Python и Node.js SDK, встроенную обсервабельность (трейсинг каждого вызова LLM, лог аудиосессий), текстовый фреймворк для тестирования без реального аудио. Документация — одна из лучших в категории, с примерами от простого бота до агента с памятью и инструментами.
По данным open.cx, LiveKit используют такие компании, как OpenAI (в Advanced Voice Mode), и это не случайно — платформа изначально проектировалась под нагрузку тысяч параллельных сессий. Apache 2.0 лицензия, self-hosted облачная версия — полная свобода развёртывания.
TEN Framework — визуальный конструктор
TEN Framework (10K ★) выделяется на фоне остальных визуальным подходом. Вместо того чтобы писать pipeline в коде, вы собираете агента из нод на графе — перетаскиваете блоки STT, LLM, TTS, RAG, инструментов и соединяете их линиями. Граф сохраняется в JSON и исполняется рантаймом.
Это не no-code для менеджеров — TEN Framework требует понимания архитектуры. Но для команд, где архитектор рисует схему, а разработчики её реализуют, визуальный граф становится документом и исполняемым кодом одновременно. Каждая нода — это отдельный микросервис, который можно запустить на отдельной машине или в Kubernetes.
Поддерживаются все популярные STT/TTS-провайдеры, включая Whisper, Azure, ElevenLabs. Есть встроенные инструменты для RAG, Function Calling, MCP-интеграция. Лицензия Apache 2.0.
TEN Framework выбирают, когда система голосового агента сложная: несколько LLM, динамическая маршрутизация, переключение языков на лету. Для простого echo-бота он избыточен — Pipecat или Vocode сделают то же самое без overhead визуального графа.
Vocode — библиотека для Python-разработчиков
Vocode (ранее vocodedev/vocode) — это самая лёгкая библиотека в пятёрке. Её идея: дать Python-разработчику инструмент, который в 50 строк кода превращает любой LLM-агент в голосового. Никакого WebRTC, никаких серверов — WebSockets и REST.
Vocode специализируется на телефонных звонках (Twilio, Vonage) и Telegram-ботах с голосом. Основной сценарий: у вас уже есть текстовый AI-агент на LangChain или OpenAI Assistants API, и вы хотите добавить ему голосовой интерфейс. Vocode делает это за полчаса.
Поддерживает Whisper, Deepgram, ElevenLabs, Azure, Google TTS. Из коробки — VAD, эхо-подавление, детекция тишины. Лицензия MIT. Единственное ограничение — Vocode не рассчитан на высокие нагрузки (сотни параллельных звонков на одной инстанции). Для продакшена с тысячами сессий выбирают LiveKit или Pipecat.
Bolna — мультиканальные voice-боты
Bolna (680 ★) — самый молодой и скромный по звёздам участник, но с одной уникальной фичей: Bolna из коробки умеет работать через SIP-телефонию. Вы подключаете SIP-транк (например, MTT, Voximplant, любую АТС) — и Bolna отвечает на звонки как виртуальный оператор.
Кроме телефонии, Bolna поддерживает Telegram, WebApp и WebSocket. В одном агенте можно настроить голосовой канал (звонки), текстовый (Telegram) и веб-виджет на сайте — вся логика общая. Это удобно для бизнеса, где клиент может начать диалог в чате, а продолжить по телефону.
В остальном Bolna уступает лидерам: меньше интеграций TTS/STT, нет видео, документация скромнее. Но если ваша задача — заменить IVR в колл-центре на AI-агента в 2026 году, Bolna может быть самым быстрым путём. MIT-лицензия, self-hosted.
Сравнительная таблица
| Фреймворк | GitHub ★ | Архитектура | Видео | Телефония | GUI | Лицензия |
|---|---|---|---|---|---|---|
| Pipecat | 13 050 | Pipeline (frame processors) | Да | Через Twilio | Нет | BSD-2 |
| LiveKit Agents | 11 148 | RTC-комната (агент = участник) | Да | Через SIP | Agent Builder | Apache 2.0 |
| TEN Framework | 10 707 | Визуальный граф нод | Да | Через ноды | Да (graph editor) | Apache 2.0 |
| Vocode | ~2 500 | Библиотека (Python) | Нет | Twilio, Vonage | Нет | MIT |
| Bolna | 681 | Мультиканальный бот | Нет | SIP (нативно) | Нет | MIT |
Данные GitHub на июнь 2026. Vocode репозиторий переехал — точное число звёзд уточнить не удалось.
Как выбрать под свой стек
Универсального ответа нет, но есть типовые сценарии, под каждый из которых подходит свой фреймворк.
Нужен продакшен с тысячами сессий и видео. LiveKit Agents. Единственный фреймворк, доказавший масштабирование на уровне OpenAI Advanced Voice. Высокая стоимость инфраструктуры (LiveKit Server + RTC-трафик) окупается стабильностью и обсервабельностью. По данным Thinnest.ai, 68% команд, запустивших voice-агента в продакшен в 2025–2026, выбрали LiveKit или Pipecat.
Сложная логика с несколькими LLM и динамическим роутингом. TEN Framework. Визуальный граф становится архитектурной схемой, которую понимают и архитектор, и разработчик. Для мультиязычных систем с переключением моделей на лету — лучший выбор.
Гибкий пайплайн с полным контролем. Pipecat. Если вы знаете, какой STT и TTS хотите использовать, и не хотите платить за WebRTC-инфраструктуру LiveKit — Pipecat даёт максимум контроля при минимуме абстракций. Архитектура frame processors позволяет подменить любой этап пайплайна без хаков.
Быстрый прототип или добавление голоса к существующему текстовому агенту. Vocode. 50 строк Python — и у вас голосовой бот. Не подходит для нагрузок выше 10–20 параллельных сессий, но для MVP или внутреннего инструмента — идеально.
IVR и колл-центр с SIP-телефонией. Bolna. Единственный фреймворк, который нативно работает с SIP-транками без Twilio-прослойки. Если ваш бизнес использует классическую телефонию (МТТ, Voximplant, билайн), Bolna сэкономит месяцы интеграции.
Что ещё важно знать
Какой фреймворк самый быстрый по задержке?
LiveKit Agents даёт минимальную задержку (200–400 мс) благодаря нативному RTC-транспорту. Pipecat — 300–500 мс. TEN Framework — 400–800 мс из-за overhead визуального графа. Vocode и Bolna — 500–1000 мс, так как используют WebSockets, а не RTC.
Какой фреймворк выбрать для замены колл-центра?
Bolna — если у вас классическая SIP-телефония (МТТ, билайн). LiveKit Agents — если готовы строить инфраструктуру на WebRTC и SIP-шлюзе. Vocode — если колл-центр на Twilio и нагрузка невысокая.
Можно ли использовать локальные LLM вместо API?
Да. Все пять фреймворков поддерживают любое OpenAI-совместимое API. Вы можете подключить Ollama, vLLM или LocalAI как бэкенд LLM. Pipecat и LiveKit имеют встроенную поддержку кастомных эндпоинтов, TEN Framework — через HTTP-ноду.
Какой TTS даёт самое натуральное звучание?
ElevenLabs — лидер по качеству (4.5–5 мс задержка), но платный. Kokoro (82M параметров) — лучший open-source вариант, работает локально на CPU. Cartesia Sonic — компромисс: низкая задержка при высоком качестве. Все четыре фреймворка поддерживают все три варианта.
Нужен ли WebRTC-сервер для голосового агента?
Для LiveKit — да, LiveKit Server обязателен (self-hosted или облачный). Pipecat использует Daily RTC (облачный) или WebSockets (self-hosted, без RTC). TEN Framework, Vocode и Bolna работают через WebSockets — дополнительный сервер не нужен. Выбор транспорта直接影响 задержку и масштабирование.