Урок 0015 · Стоимость и capacity planning

Как считать стоимость LLM-приложения и когда GPU окупается против API. Продолжение урока 0009 с цифрами и формулами.

Цель урока Посчитать стоимость диалога каре (токены × цена), прикинуть бюджет на объёме и назвать, когда local окупается.

1. Базовый расчёт: стоимость диалога

Стоимость = входные токены × цена входа + выходные токены × цена выхода.

Пример: модель $3/M вход, $15/M выход. Диалог каре: 2000 токенов вход (система + RAG-контекст + история), 300 токенов выход.

вход:  2000 × $3/M   = $0.006
выход:  300 × $15/M  = $0.0045
итого ≈ $0.0105 за диалог

100 000 диалогов/мес → $1 050/мес. Теперь понятно, почему «дёшево на старте» превращается в заметные деньги.

2. Куда уходят токены (и как резать)

Правило: считай стоимость на РЕАЛЬНОМ распределении (с ретраями, с ошибками), не на идеальном случае.

3. Когда local окупается: точка безубыточности GPU

Грубая модель: аренда GPU (A100/H100) = $X/час; API-стоимость = $Y за твоё суточное число токенов.

Точка безубыточности: когда суточный объём × цена API ≥ суточная аренда GPU.

Пример: аренда 1×H100 ≈ $2–3/час ≈ $50–70/день. Если твой трафик через API стоит > $50/день — local начинает окупаться. Если $5/день — не окупится никогда.

Плюс к аренде: инженерное время на vLLM, обслуживание, холодный старт. Минус: качество открытой модели vs фронтир — это тоже «стоимость» (хуже ответы = больше эскалаций).

4. Capacity planning: сколько GPU

  1. Пиковый RPS и токены/запрос (из метрик прода, не из фантазии).
  2. Throughput одного GPU — с vLLM и continuous batching: для 7B модели это ~сотни-тысячи токенов/с, но мерь на своей нагрузке.
  3. Параллельность: max-num-seqs × средние токены = сколько влезает в KV cache.
  4. Формула: нужный throughput / throughput одного GPU + запас 30–50% на пики и ретраи.
  5. Автоскейлинг: min/max реплик, warm pool (холодный старт = минуты, урок 0009).

Метрики для планирования: RPS, токены/мин, KV cache usage (vLLM /metrics — урок 0009), queue length (урок 0009).

5. Гибирид как экономия (урок 0009, теперь с цифрами)

Роутер: простые запросы → дешёвая локальная 7B, сложные → API-фронтир. Если 70% трафика простое — платишь фронтиром только за 30%.

Судья — сильная модель, прод — дешёвая (урок 0006). Это и есть экономия: дорогую модель зовёшь туда, где нужна точность.

Проверь себя

Системный промпт платится?

Local окупается, когда?

Стоимость считают на?

Видео и статьи

Первоисточник урока vLLM docs (capacity) + Anthropic prompt caching (экономия) + урок 0009 (гибрид). Цифры цен — проверяй на прайсах провайдеров.

Sources: