# Checklist запуска эксперимента с промптом

## До offline-эксперимента

- [ ] Запишите одну гипотезу изменения и одну основную метрику.
- [ ] Отделите guardrails от основной метрики.
- [ ] Заморозьте датасет или зафиксируйте его точную ревизию.
- [ ] Оставьте одинаковыми модель, tools, retrieval и параметры генерации.
- [ ] Заранее решите, как учитывать ошибки, пустые ответы и повторы.
- [ ] Выберите метод анализа до просмотра результатов вариантов.

## До production canary

- [ ] Убедитесь, что candidate прошёл датасет и ручной разбор ошибок.
- [ ] Назначьте двум версиям промпта разные labels в Langfuse.
- [ ] Распределяйте по стабильному идентификатору субъекта, а не при каждом
      запросе.
- [ ] Не передавайте сырые идентификаторы пользователей в трейсы и evidence
      bundle.
- [ ] Зафиксируйте плановую долю candidate и проверьте фактическое
      распределение.
- [ ] Определите условие остановки для каждого safety- и business-guardrail.
- [ ] Проверьте, что прошлую production-версию можно быстро вернуть.

## До принятия решения

- [ ] Проверьте дубли субъектов, пропуски, повторы и перекос распределения.
- [ ] Сравните основную метрику и каждый guardrail отдельно.
- [ ] Посмотрите на latency, стоимость и ошибки, а не только на среднее.
- [ ] Укажите неопределённость и точное окно наблюдения.
- [ ] Не называйте маленькую выборку доказательством отсутствия эффекта.
- [ ] Не выпускайте candidate, если ухудшился критический guardrail.
- [ ] Сохраните версии промптов, датасета, кода и результат анализа.

Лицензия: CC BY 4.0. Правила атрибуции находятся в `LICENSE-CC-BY-4.0.md`.
