Фундамент: Эвалюации как основа
Промптинг начинается не с написания инструкций, а с установки объективной системы оценки. Перед любыми изменениями вам нужен набор тест-кейсов, который позволяет измерить влияние каждого правки — либо улучшение, либо деградация.
Совет: Если вы не знаете, работает ли ваш промпт, вы всегда пишете вслепую. Эвалюации — это ваша система мониторинга.
Три типа тест-кейсов:
- Контрольный случай. Простой, однозначный запрос, который должен всегда проходить. Если он начинает падать, вы сломали что-то важное.
- Пограничные случаи (Edge cases). Ситуации, где модель ранее ошибалась — расчёты, исключения, редкие комбинации правил.
- Проверка границ и отказ. Понимает ли модель, когда нужно передать задачу человеку или отказаться выполнять неправомерный запрос?
Пример из кейса: Телеком-компания (поддержка клиентов)
- Контрольный: «Каков лимит данных в базовом тарифе?» → модель должна дать точную цифру из контекста.
- Пограничный: Расчёт пропорционального счёта при смене тарифа в середине месяца → требует точных вычислений.
- Проверка эскалации: При биллинговой ошибке модель должна предложить спецалиста, а не полезно рассуждать.
- Проверка утаивания: Не скрывает ли модель информацию, к которой она имеет полный доступ в контексте?
Важно: Эвалюация должна быть настолько строгой, что любое улучшение гарантирует реальный прогресс. Не ослабляйте критерии на бегу.