Содержание
- Почему обычный мониторинг не работает с AI-агентами
- Langfuse — самая популярная open-source LLM-платформа
- Arize Phoenix — OpenTelemetry-native observability
- Comet Opik — evaluation-first платформа от Comet
- Helicone — AI Gateway + observability в одном флаконе
- OpenLLMetry — OpenTelemetry для LLM от Traceloop
- MLflow — AI-платформа от Databricks с LLM-трейсингом
- Сравнительная таблица
- Коротко: как выбрать
Запустить AI-агента в продакшен — полдела. Понять, почему он сделал именно такой вывод, куда ушли токены и не зациклился ли он на одном рассуждении — вот где начинается настоящая боль. Gartner сообщает, что 83% организаций уже используют AI-агентов, но только 13% как-то их контролируют. LLM observability — это та самая дисциплина, которая превращает агента из чёрного ящика в инструмент, которому можно доверять.
Почему обычный мониторинг не работает с AI-агентами
Классический APM (Application Performance Monitoring) меряет latency, error rate и throughput. С LLM-приложениями этого катастрофически мало. Агент может ответить за 200 мс с правильным HTTP-статусом 200 — и при этом дать полностью галлюцинированный ответ, вызвать не тот инструмент или потратить $50 на токены в бесконечном цикле рассуждений.
Digital Applied выяснили, что 51% компаний уже имеют AI-агентов в продакшене, и ещё 23% расширяют пилотные проекты. Но чем сложнее агент — тем недетерминированнее его поведение. Агент с планированием, памятью, инструментами и рефлексией может пройти 15–30 шагов рассуждения, и каждый шаг — это вызов LLM, чтение памяти, запись, вызов API. Без трейсинга восстановить, что пошло не так, практически невозможно.
Трейсинг. Запись каждого шага агента: какой промпт отправлен, какой ответ получен, сколько токенов потрачено, какие инструменты вызваны, какой был контекст на момент решения. Без трейсинга отладка мультиагентной системы превращается в гадание — вы видите только финальный ответ, но не понимаете, почему агент пошёл именно по этому пути.
Оценка (evals). Автоматическая проверка качества ответов — LLM-as-a-judge, семантическое сходство, точность извлечения фактов. Например, для RAG-агента нужно измерять, насколько ответ соответствует контексту (answer relevancy) и не содержит ли он галлюцинаций (hallucination score).
Мониторинг. Дашборды с метриками, алерты при аномалиях, анализ затрат по моделям и пользователям. Сколько токенов съедает каждый агент в день? Какая модель даёт лучший quality-price ratio? Без observability ответа на эти вопросы нет — только приблизительные оценки.
Ниже — шестёрка open-source инструментов, которые закрывают эти задачи. Все поддерживают самохостинг, не требуют отправки данных в облако (критично для российских компаний с 152-ФЗ) и имеют активное сообщество.
Langfuse — самая популярная open-source LLM-платформа
Langfuse — это open-source AI engineering platform, лидер категории с 29 444 звёздами на GitHub и лицензией MIT. Проект стартовал в 2023 году как YC W23 и к середине 2026 стал стандартом де-факто для LLM observability. Официальный сайт сообщает о 50M+ SDK-установок в месяц и 6M+ Docker-пулов.
Из коробки Langfuse даёт: распределённый трейсинг с деревом вызовов (родитель-потомок), дашборды с метриками latency/tokens/cost, prompt management с версионированием и A/B-тестами, eval harness с LLM-as-a-judge, датасеты для регрессионного тестирования, плейграунд для прямых запросов к LLM.
Отдельно стоит сказать про prompt management. В Langfuse можно хранить все версии промптов, тегировать их, запускать A/B-тесты прямо в UI. Для команды из 3–5 разработчиков это закрывает потребность в отдельном инструменте управления промптами — не нужно ставить Portkey или Agenta.
Интеграция — одна строка кода: SDK есть для Python, JS/TS, и нативные интеграции с LangChain, LlamaIndex, OpenAI SDK, LiteLLM, Haystack, CrewAI, DSPy. Данные хранятся в ClickHouse — можно держать миллионы спанов без деградации.
Самохостинг: docker compose up — и платформа работает на вашем сервере. Есть облачная версия с бесплатным tiers (до 50K наблюдений в месяц). Для стартапов и средних проектов — лучший вариант, если не хочется писать обвязку самому.
Из недостатков: ClickHouse требует 4+ GB RAM для нормальной работы на самохостинге, плюс при высоких нагрузках (100K+ спанов/день) база данных начинает кушать ресурсы. Для маленьких проектов это избыточно — можно начать с облачного tiers (50K наблюдений бесплатно) и переехать на self-hosted, когда нагрузка вырастет.
Ещё один нюанс: Langfuse не умеет работать как прокси или AI Gateway. Если вам нужно перехватывать запросы без SDK (например, для легаси-приложения, которое шлёт запросы напрямую в OpenAI), потребуется дополнительный слой — Helicone или Portkey.
Arize Phoenix — OpenTelemetry-native observability
Arize Phoenix — это open-source AI observability platform от Arize AI (10.2K+ звёзд на GitHub). Phoenix изначально строился на OpenTelemetry через собственное расширение OpenInference — в отличие от Langfuse, где OTel-экспорт появился позже.
Phoenix даёт трейсинг с визуализацией графа вызовов (удобно для мультиагентных систем), LLM-as-a-judge evals, дашборды с мониторингом latency/tokens/error rate, эксперименты с промптами в Jupyter-ноутбуках, и рекордер для офлайн-отладки.
Ключевое отличие Phoenix от Langfuse — глубокая интеграция с Jupyter. Phoenix удобно использовать как библиотеку для Python — pip install arize-phoenix, запустить в ноутбуке, провести эксперимент, посмотреть трейсы. Это идеальный подход для data scientist'ов, которые хотят отлаживать агентов не выходя из ноутбука.
Arize AI обрабатывает 1 триллион спанов и 50+ миллионов evaluation'ов ежемесячно — платформа проверена на enterprise-нагрузках. Самохостинг через Docker или pip. Phoenix — это open-source слой, а Arize AX — enterprise-продукт с Compliance и Governance.
Минус: сообщество меньше, чем у Langfuse — 10K vs 29K звёзд. Документация на русском отсутствует. Для простых сценариев может показаться перегруженным.
Comet Opik — evaluation-first платформа от Comet
Comet Opik — это open-source платформа для Debug, Evaluate и Monitor LLM-приложений (~18.5K звёзд на GitHub, лицензия Apache 2.0). Проект развивается Comet — компанией с 7+ лет опыта в experiment tracking для ML.
Opik ориентирован в первую очередь на evaluation: автоматические скоринговые правила для входящих трейсов, LLM-as-a-judge, сравнение ответов моделей side-by-side, дашборды с feedback scores, latency, cost и error rate. Если ваша главная боль — не «где тормозит», а «правильно ли отвечает», Opik это закрывает лучше конкурентов.
Интеграция через Python SDK (pip install opik) и декораторы. Есть нативные интеграции с OpenAI, LangChain, LiteLLM, LlamaIndex. Self-hosted через Docker.
Opik интересен тем, кто уже использует Comet для experiment tracking — единая экосистема. Отдельно стоит отметить визуализацию графов для мультиагентных систем: Opik строит полную карту вызовов с таймингами на каждом шаге.
Слабое место: меньше интеграций с фреймворками, чем у Langfuse. Нет встроенного prompt management. Сообщество растёт, но пока уступает Langfuse.
Helicone — AI Gateway + observability в одном флаконе
Helicone — это open-source AI Gateway и LLM Observability Platform (~5.8K звёзд на GitHub). Ключевая особенность: прокси-архитектура. Вы направляете запросы к LLM через Helicone (OpenAI-совместимый API), и он автоматически логирует всё: промпты, ответы, токены, задержки, ошибки. Одна строка кода — base_url = "https://oai.helicone.ai/v1" — и observability включена без SDK.
Помимо логирования, Helicone работает как AI Gateway: предоставляет доступ к 100+ моделям через единый API, интеллектуальную маршрутизацию запросов (самый дешёвый / быстрый / точный), fallback при отказе провайдера, rate limiting и кэширование. Легковесная архитектура — ~8ms P50 latency и 64MB memory footprint.
Helicone идеален для команд, которые хотят быстро подключить observability без изменения кода — просто сменить base_url в клиенте. Self-hosted через Docker. Есть облачная версия.
Минусы: не такой богатый eval-фреймворк, как у Langfuse или Opik. Нет prompt management-a. Фокус на observability через прокси, а не на полном жизненном цикле LLM.
OpenLLMetry — OpenTelemetry для LLM от Traceloop
OpenLLMetry — это набор расширений OpenTelemetry для LLM и GenAI-приложений от Traceloop (приобретён ServiceNow). Это не полноценная платформа, а инструментационная библиотека — вы добавляете пару строк кода, и OpenTelemetry начинает собирать спаны для LLM-вызовов, векторных БД, инструментов агентов.
Преимущество OpenLLMetry — стандартизация. Если в вашей компании уже внедрён OpenTelemetry-стек (Jaeger, SigNoz, Grafana Tempo), OpenLLMetry встраивается в него без нового тулчеинга. Поддерживаются Python, JS/TS, Go и Ruby SDK.
OpenLLMetry не даёт eval-фреймворка, prompt management или дашбордов — он только собирает данные в OTel-формате. Визуализацию и алерты вы делаете через существующие инструменты. Это архитектурно правильный, но более сложный путь — требует DevOps-компетенций.
Кому подходит: инженерные команды с опытом OpenTelemetry, которые хотят добавить LLM в существующий мониторинг, не плодя новые системы.
MLflow — AI-платформа от Databricks с LLM-трейсингом
MLflow — это крупнейшая open-source AI engineering platform (20K+ звёзд на GitHub, Apache 2.0). Исторически MLflow использовался для experiment tracking (логирование параметров, метрик, артефактов ML-экспериментов). В 2025–2026 MLflow добавил полноценный LLM трейсинг, agent observability и evaluation — и теперь конкурирует напрямую с Langfuse и Phoenix.
MLflow даёт: распределённый трейсинг с визуализацией графа вызовов, автоматическое логирование для LangChain / LlamaIndex / OpenAI, prompt versioning, automated evaluation с LLM-as-a-judge и RAG-метриками, trace replay (повторная обработка трейсов с новой моделью), дашборды latency/cost/quality. Всё это — в единой платформе, которая до этого использовалась только для experiment tracking.
Trace replay — killer feature MLflow: вы можете взять продакшен-трейс (с реальным промптом и контекстом), прогнать его через новую версию модели и сравнить ответы. Это ускоряет регрессионное тестирование в разы — не нужно собирать датасет и писать тесты, трейсы уже есть.
Для команд, которые уже используют MLflow для классического ML, это естественное расширение — один стек для ML и LLM. По данным MLflow, платформой пользуются Airbus, SAP, BMW — enterprise-нагрузка подтверждена.
Минус: MLflow — это монолит, который исторически проектировался для experiment tracking. LLM-трейсинг добавлен как надстройка, и некоторые интеграции (особенно с CrewAI и многоагентными системами) менее зрелые, чем у Langfuse.
Сравнительная таблица
| Инструмент | Звёзды GitHub | Лицензия | Трейсинг | Evals | Prompt mgmt | AI Gateway | Самохостинг |
|---|---|---|---|---|---|---|---|
| Langfuse | 29K+ | MIT | ✅ | ✅ | ✅ | ❌ | Docker |
| Arize Phoenix | 10.2K | OSS | ✅ | ✅ | ❌ | ❌ | pip/Docker |
| Comet Opik | 18.5K | Apache 2.0 | ✅ | ✅ | ❌ | ❌ | Docker |
| Helicone | 5.8K | OSS | ✅ | ⚡ | ❌ | ✅ | Docker |
| OpenLLMetry | — | Apache 2.0 | ✅ | ❌ | ❌ | ❌ | pip |
| MLflow | 20K+ | Apache 2.0 | ✅ | ✅ | ✅ | ❌ | pip/Docker |
⚡ = частичная поддержка (базовый мониторинг, без advanced eval-фреймворка)
Коротко: как выбрать
Если ваша команда только начинает разбираться с LLM observability — берите Langfuse. Это самый зрелый open-source проект с наибольшим сообществом, prompt management, evals и трейсингом из коробки. Он закроет 90% потребностей типового AI-продукта.
Если вы data scientist и привыкли работать в Jupyter — попробуйте Phoenix. Он запускается из ноутбука, даёт трейсинг без DevOps и отлично подходит для исследовательских прототипов.
Если главная боль — качество ответов, а не производительность — смотрите в сторону Opik. Его evaluation-first подход (автоматические скоринговые правила, LLM-as-a-judge) даёт более глубокий контроль над тем, что генерирует агент.
Если хотите быстро подключить observability без SDK — Helicone решит задачу через прокси за 5 минут. Плюс получите AI Gateway для маршрутизации между провайдерами.
Если у вас уже есть OpenTelemetry-стек — используйте OpenLLMetry, чтобы не плодить новые системы. Если используете MLflow для классического ML — LLM-трейсинг в нём уже есть, и он становится всё зрелее.
Самое важное отличие — архитектурное: Langfuse, Phoenix, Opik и MLflow — это полноценные платформы, которые дают вам UI, дашборды, eval-фреймворк и управление промптами. Helicone — это прокси, через который проходят все LLM-запросы, и observability — лишь одна из его функций (наряду с маршрутизацией и fallback). OpenLLMetry — это не платформа, а инструментационная библиотека без UI.
Если вы разрабатываете AI-агента и хотите видеть каждый его шаг — выбирайте Langfuse или Phoenix. Если вам нужно разгрузить команду DevOps и не плодить инфраструктуру — OpenLLMetry с существующим OTel-стеком. Если параллельно нужен AI Gateway с failover между Anthropic и OpenAI — Helicone.
По данным Firecrawl, рынок LLM observability вырос на 300% за 2025–2026 годы. Инструменты стремительно догоняют друг друга по функциональности — то, что сегодня есть только в Langfuse, завтра появится в MLflow. Главное — начать мониторить своих агентов уже сейчас, пока 87% компаний ещё этого не делают.