Слова, которые встречаются в статьях. Что это, чем отличается, фраза на собеседовании.
Open-source (Phoenix) + enterprise (AX) платформа трейсинга и eval LLM/агентов на OpenTelemetry + OpenInference. Петля: прод-трейс → фейл → датасет → регресс.
Фраза: «Повесил бы OpenTelemetry-трейсы с первого дня. Phoenix — если нужен self-host, Braintrust — если команда живёт в eval playground».
Коммерческая (есть free tier) платформа eval-first: датасеты, эксперименты, сравнение промптов A/B, CI. Workflow: Instrument → Observe → Annotate → Evaluate → Deploy.
Отличие от Phoenix: сильнее сторона до релиза (playground), Phoenix — прод-наблюдаемость.
LangSmith — трейсинг + offline/online eval в экосистеме LangChain. Langfuse — self-hosted open-source альтернатива для команд с требованиями к данным.
Open-source CLI: матричные сравнения промптов, red-teaming, CI, свои метрики и судьи. «Test-driven LLM development».
Библиотека метрик для RAG/агентов: faithfulness, context recall/precision, answer relevancy, tool-call accuracy, agent goal accuracy. Метрики = LLM-суждения.
Open-source (25M+ загрузок) библиотека + UI для eval и мониторинга RAG: precision@k, hit rate, LLM-судьи, синтетические датасеты, трейсинг.
Java-библиотека/сервис: достаёт текст и метаданные из 1000+ форматов (PDF, Office, HTML). 4.x отдаёт Markdown «для LLM/RAG». Парсинг в отдельных процессах (fork) — враждебный файл убивает процесс, не сервис.
Это не OCR: скан без текстового слоя → Tika пустой → нужен OCR (Tesseract/DocTR).
Реактивный Python-ноутбук вместо Jupyter: ячейки = граф зависимостей, нет hidden state, файл = чистый .py (git-friendly). Удобен как data viewer / annotation app для error analysis.
Open-стандарт подключения AI-приложений к внешним системам: данные, тулы, воркфлоу. «USB-C для AI». Anthropic, поддержан широко (Claude, ChatGPT, VS Code…).
People + AI Research. Гайд по дизайну AI-продуктов с человеком в центре: 6 глав (user needs + success, data, onboarding, explainability, feedback, errors). Не про метрики — про то, как определить success до модели.
Primitives: Agent (LLM + instructions + tools), Agents-as-tools / Handoffs, Guardrails. Встроенные tracing, sessions (персистентная память), HITL, sandbox agents.
Harness от Anthropic: контекст-менеджмент (compaction), тулы, длинные циклы. Использован в их long-running harness (initializer + coding agent).