Как сравнивать промпты и модели LLM перед запуском конвейера? В прошлый раз…
Как сравнивать промпты и модели LLM перед запуском конвейера?
В прошлый раз разбирали как ловить плохую статью на выходе с помощью deepeval. Но можно ловить раньше: на самом промпте и модели, которой вы этот промпт скармливаете (спасибо, Кэп!). Инструмент для этого — бесплатный promptfoo (есть веб-версия на локалке и CLI).
Перечисляете промпты, модели и тесты с проверками, а promptfoo проверит их: каждый промпт * каждую модель * каждую проверку.
Проверки здесь двух видов, прям как в deepeval:
— Детерминированные: Проверяют, что в тексте есть нужное число, есть таблица и т.д. Это бесплатно.
— LLM-судья: Критерий пишется обычным текстом. Например: "верно ли передана механика?". Платим за токены.
С помощью promptfoo очень быстро можно протестировать новую модель, сравнив ее с другими.
h2: Лайв-тест
Я взял слот Gates of Olympus и собрал по нему: RTP, максимальный выигрыш, механика, множители, фриспины, ставки. И дал задание 14 моделям (OpenAI от gpt-4o-mini до gpt-5.6, плюс китайские Kimi-K3, GLM-5.2, Qwen3.8) написать обзор слота двумя промптами: по памяти и с фактами внутри промпта.
h3: Результаты по памяти
— gpt-5.4-mini перепутал механику: назвал "Pay Anywhere / Cluster" вместо Scatter Pays. Насчитал 6 номиналов множителей вместо 15, заявил, что бонуса нет (есть).
— gpt-5.6-sol выдумал номинал множителя 75x, которого в игре не существует, и hit frequency 27,27% (реальная 28,82%).
— gpt-4o-mini перепутал вообще все выплаты за скаттеры (5x/100x/500x вместо 3x/5x/100x).
— gpt-4.1-mini уверенно написал, что Ante Bet и Buy Feature "отсутствуют". Обе функции есть.
— gpt-5.4-nano выдал сетку 5×4 вместо 6×5.
Ноль галлюцинаций у gpt-4o, gpt-5, gpt-5.2, Kimi-K3 и Qwen3.8 — они либо знают точные цифры, либо честно пишут "нет данных". Отдельно отмечу Kimi-K3: китайская модель знает слоты не хуже топового OpenAI (25 верных фактов, ноль галлюцинаций).
h3: Результаты с фактами
Промпт с фактами внутри — обнулил галлюцинации у всех 14 моделей. Ноль. Включая тех, кто по памяти путал механику.
h2: Вывод
Имея пару промптов и базу фактов, вы за полчаса получаете объективный, воспроизводимый рейтинг любых моделей по своей теме. Вышла новая модель — добавили строчку в конфиг, прогнали, увидели ее место в рейтинге.
Про LLM-судью: где нужна смысловая оценка, берите gpt-5-mini.
Сколько стоит? Весь эксперимент — 14 моделей, два прогона, сотни проверок — обошелся меньше чем в доллар.
Вставить свои 5 копеек: