Глоссарий инструментов

Слова, которые встречаются в статьях. Что это, чем отличается, фраза на собеседовании.

Наблюдаемость и eval

Arize / Phoenix

Open-source (Phoenix) + enterprise (AX) платформа трейсинга и eval LLM/агентов на OpenTelemetry + OpenInference. Петля: прод-трейс → фейл → датасет → регресс.

Фраза: «Повесил бы OpenTelemetry-трейсы с первого дня. Phoenix — если нужен self-host, Braintrust — если команда живёт в eval playground».

Braintrust

Коммерческая (есть free tier) платформа eval-first: датасеты, эксперименты, сравнение промптов A/B, CI. Workflow: Instrument → Observe → Annotate → Evaluate → Deploy.

Отличие от Phoenix: сильнее сторона до релиза (playground), Phoenix — прод-наблюдаемость.

LangSmith / Langfuse

LangSmith — трейсинг + offline/online eval в экосистеме LangChain. Langfuse — self-hosted open-source альтернатива для команд с требованиями к данным.

Promptfoo

Open-source CLI: матричные сравнения промптов, red-teaming, CI, свои метрики и судьи. «Test-driven LLM development».

Ragas

Библиотека метрик для RAG/агентов: faithfulness, context recall/precision, answer relevancy, tool-call accuracy, agent goal accuracy. Метрики = LLM-суждения.

Evidently

Open-source (25M+ загрузок) библиотека + UI для eval и мониторинга RAG: precision@k, hit rate, LLM-судьи, синтетические датасеты, трейсинг.

Ingestion / данные

Apache Tika

Java-библиотека/сервис: достаёт текст и метаданные из 1000+ форматов (PDF, Office, HTML). 4.x отдаёт Markdown «для LLM/RAG». Парсинг в отдельных процессах (fork) — враждебный файл убивает процесс, не сервис.

Это не OCR: скан без текстового слоя → Tika пустой → нужен OCR (Tesseract/DocTR).

Marimo

Реактивный Python-ноутбук вместо Jupyter: ячейки = граф зависимостей, нет hidden state, файл = чистый .py (git-friendly). Удобен как data viewer / annotation app для error analysis.

Протоколы / UX

MCP (Model Context Protocol)

Open-стандарт подключения AI-приложений к внешним системам: данные, тулы, воркфлоу. «USB-C для AI». Anthropic, поддержан широко (Claude, ChatGPT, VS Code…).

PAIR Guidebook (Google)

People + AI Research. Гайд по дизайну AI-продуктов с человеком в центре: 6 глав (user needs + success, data, onboarding, explainability, feedback, errors). Не про метрики — про то, как определить success до модели.

SDK для агентов

OpenAI Agents SDK

Primitives: Agent (LLM + instructions + tools), Agents-as-tools / Handoffs, Guardrails. Встроенные tracing, sessions (персистентная память), HITL, sandbox agents.

Claude Agent SDK

Harness от Anthropic: контекст-менеджмент (compaction), тулы, длинные циклы. Использован в их long-running harness (initializer + coding agent).