Детали статьи

Почему большинство AI-пилотов не доходит до продакшена
ПродуктСтартапыИИ

Почему большинство AI-пилотов не доходит до продакшена

Вернуться назад

Рабочее AI-демо занимает у хорошего инженера примерно неделю. AI-функция, на которую могут положиться десять тысяч клиентов, занимает квартал. Почти все заглохшие AI-проекты, которые нас просят спасти, умерли в промежутке между этими двумя предложениями — и причины повторяются с редким постоянством.

Причина первая: никто не определил, что такое «хорошо»

«Пусть отвечает на вопросы поддержки» — это не спецификация. «Пусть закрывает 40% обращений первой линии без эскалации, с долей неверных ответов ниже 2%, замер еженедельно на фиксированной выборке из 200 реальных тикетов» — уже спецификация. Без второй формулировки не наступает момент, когда кто-то может сказать «готово», поэтому запуска не происходит.

Сначала пишется цель, потом промпт. Если вы не можете назвать порог — вы готовы не к разработке, а к двухнедельной оценке.

Причина вторая: данных на самом деле не было

Пилот работает на выгрузке, собранной вручную. Продакшен работает на живых системах с правами доступа, устаревшими записями и клиентами, которые удалили аккаунт в прошлый вторник. Непарадная работа по доставке чистых, актуальных и разграниченных по доступу данных до модели регулярно занимает две трети проекта и почти никогда не входит в оценку пилота.

Причина третья: нет запасного пути

Любая AI-функция иногда ошибается. Те, что доходят до продакшена, имеют ответ на вопрос «и что дальше»: эскалация человеку, черновик с порогом уверенности, честный отказ вместо выдумки. Те, что не доходят, — это функции, у которых ошибка не имеет заданных последствий, поэтому юристы и поддержка тихо блокируют релиз.

Причина четвёртая: у оценки качества нет владельца

Поведение модели дрейфует, провайдеры выключают версии, ваши собственные правки промптов взаимодействуют друг с другом. Если никто не отвечает за регрессионный набор, который прогоняется на каждом изменении, качество деградирует незаметно — до первой публичной жалобы клиента.

  • Фиксированный набор реальных запросов с ожидаемыми результатами, лежащий в репозитории.
  • Автоматический прогон при каждом изменении промпта, модели или поиска.
  • Конкретный человек, который читает недельные цифры.
  • Описанный откат к последней заведомо рабочей конфигурации.

Если функцию нельзя оценить автоматически — её нельзя поддерживать. Всё остальное это демо с назначенной датой релиза.

Ничего экзотического здесь нет. Это та же дисциплина, что отделяет прототип от продукта в любой другой области, — просто её чаще пропускают, когда демо достаточно впечатляет зал.

Теги