Помощник поддержки стоил $0,06 за диалог. В презентации это выглядело прекрасно. Через месяц финансовый директор увидел другую цифру: $0,74 за решённое обращение. Модель вызывали повторно после невалидного JSON, часть ответов проверял оператор, а каждый восьмой клиент возвращался с тем же вопросом.
Единица должна совпадать с пользой
Цена вызова нужна для отладки инфраструктуры. Экономика продукта считается на завершённое полезное действие: решённый тикет, принятый документ, опубликованный материал. Если фича экономит время сотрудника, берите фактическое время до и после, а не оптимистичные секунды из демо.
def unit_economics(*, requests, success_rate, model_cost,
infra_cost, review_minutes, hourly_rate,
saved_minutes, value_per_success):
successes = requests * success_rate
review_cost = requests * review_minutes / 60 * hourly_rate
total_cost = model_cost + infra_cost + review_cost
saved_cost = successes * saved_minutes / 60 * hourly_rate
value = successes * value_per_success + saved_cost
return {
"cost_per_success": total_cost / max(successes, 1),
"net_value": value - total_cost,
"margin_per_success": (value - total_cost) / max(successes, 1),
}В расчёт входят production-вызовы, retries, evals, embeddings, хранение, observability и человеческая проверка. Разработка и сопровождение считаются отдельно как постоянные затраты. Затем нужен сценарий объёма: при росте трафика модельная стоимость растёт почти линейно, а дежурство и разработка ступенями.
Кейс с честным знаменателем
Из 10 000 обращений помощник попытался закрыть 6 000. Без повторного контакта закрылись 4 800. Модель и инфраструктура стоили $900, проверка операторов $1 200, сопровождение $600. Значит, переменная и операционная цена успешного решения равна $0,56, а не $0,15, полученные делением модельного счёта на число попыток. Сравнивать её надо со стоимостью прежнего решения тех же 4 800 обращений.
Где расчёт врёт
Команда считает все сгенерированные ответы успехом. Экономию минут умножают на полную зарплату, хотя освобождённое время ничем не занято. Редкие дорогие ошибки прячут в среднем. Бесплатный пилот провайдера переносят в прогноз года. Рост повторных обращений не связывают с фичей.
Для риска полезен отдельный член:
ожидаемый ущерб = вероятность ошибки * цена ошибкиСредняя маржа не оправдывает автоматическую отправку платежа, если один неверный платёж съедает год экономии.
Правило: защищайте не цену токена, а стоимость проверенного результата с учётом труда и ошибок.
Практикум 47.1
Выберите одну AI-фичу и соберите данные за неделю. Определите полезную единицу и окно повторного обращения. Рассчитайте базовый, плохой и хороший сценарии, отдельно покажите постоянные затраты и ожидаемый ущерб. Запишите порог остановки: при какой стоимости результата или доле ошибок фича отключается.