Качество ИИ-консультанта проверяют набором реальных типов вопросов, включая неизвестные и спорные. Красивый ответ не заменяет правильность и соблюдение границ.
Соберите проверочный набор
Возьмите обезличенные типовые вопросы клиентов: что входит в услугу, кому подходит, какие вводные нужны. Добавьте неполные формулировки, вопросы вне темы и просьбы подтвердить несуществующее условие. Для каждого случая подготовьте допустимый ответ или правильную передачу человеку.
Условный пример: на вопрос о цене при отсутствии данных консультант объясняет порядок оценки. Ответ с придуманной суммой нельзя оценивать как хороший только потому, что он краткий и уверенный.
Оценивайте несколько свойств
Проверяйте соответствие фактам, полноту по задаче, понятность, отсутствие лишних данных и правильное действие при неизвестности. Сохраняйте отдельные причины ошибки. Общая оценка скрывает, что консультант хорошо пишет, но неправильно обещает сроки.
Условия теста должны быть воспроизводимыми: версия базы, настройки и набор вопросов. При сравнениях используйте одинаковые задания. Несколько удачных ответов не являются доказательством универсальной надёжности. Оставьте существенные ограничения в описании продукта.
Свяжите проверку с эксплуатацией
После обновления источников или модели повторите связанные тесты. В работе предусмотрите доступный способ сообщить об ошибке и передать вопрос человеку. Сохраняйте только необходимые сведения для контроля, избегая лишней клиентской истории.
Успех определяется тем, помогает ли консультант решить разрешённую задачу без неподтверждённых условий. Скорость и стиль имеют значение после правильности. Решение о запуске принимают по конкретному сценарию и последствиям ошибки, а не впечатлению от демонстрационного разговора.
- Обычные и неизвестные вопросы.
- Эталон фактов и границ.
- Отдельные причины ошибок.
- Сохранённые условия теста.
- Проверка после обновлений.
