Когда промпт решает, когда нет, и как строить промпты, которые переживают собеседование и продакшн.
Anthropic прямо пишут: не всякий failing eval решается промптом. Иногда латентность и стоимость проще улучшить сменой модели.[107]
Прежде чем промптить, нужно: (1) определить критерии успеха, (2) уметь их тестировать, (3) иметь черновик промпта.[107]
Это совпадает со всем курсом: eval раньше, потом итерация.
Базовый скелет для продуктового промпта:
Система: кто ты, в каком формате отвечаешь, чего НЕ делать.
Контекст: найденные документы, политики, данные.
Задача: что сделать с контекстом, явные правила.
Формат: JSON / таблица / цитаты [1], [2].
Few-shot: 1–3 примера «вход → идеальный выход».
Почему так:
| Техника | Что делает | Когда |
|---|---|---|
| Few-shot | Примеры «вход → выход» в промпте | Формат, тон, крайние случаи |
| Chain-of-thought (CoT) | «Подумай шагами перед ответом» | Логика, расчёты, многошаговые задачи |
| XML/структурная разметка | Теги <context> <task> вокруг блоков | Сложные промпты, парсинг, RAG |
| Role prompting | «Ты — эксперт по политикам банка» | Тон и границы |
| Prompt chaining | Разбить на шаги с проверкой между ними | Сложная задача = 2 простых вызова |
Источник: Prompt Engineering Guide (dair-ai), Anthropic prompt engineering docs.[108][107]
Примеры важнее инструкций: один пример «как ответить на запрос про лимит» говорит модели больше, чем абзац правил.
Правила хорошего few-shot:
CoT (chain-of-thought): просьба думать шагами перед ответом. Улучшает логику, но: дороже (больше выходных токенов), медленнее, и для фактов не нужен.
Для каре: «2% или 1.5%?» — это факт из контекста, CoT не нужен, нужен T=0 и сверка с контекстом (урок 0002).
CoT нужен для: расчётов, сравнения условий, multi-hop рассуждений.
Практика Anthropic: межстрочное thinking (interleaved thinking) даёт reasoning «из коробки» в новых моделях.[30]
Что лучше учит модель формату?
CoT нужен для?
Правку промпта нужно проверять?