Главная страница TG News Как сравнивать промпты и модели LLM перед запуском конвейера?

Как сравнивать промпты и модели LLM перед запуском конвейера?

В прошлый раз разбирали как ловить плохую статью на выходе с помощью deepeval. Но можно ловить раньше: на самом промпте и модели, которой вы этот промпт скармливаете (спасибо, Кэп!). Инструмент для этого — бесплатный promptfoo (есть веб-версия на локалке и CLI).

Перечисляете промпты, модели и тесты с проверками, а promptfoo проверит их: каждый промпт * каждую модель * каждую проверку.

Проверки здесь двух видов, прям как в deepeval:
— Детерминированные: Проверяют, что в тексте есть нужное число, есть таблица и т.д. Это бесплатно.
— LLM-судья: Критерий пишется обычным текстом. Например: «верно ли передана механика?». Платим за токены.

С помощью promptfoo очень быстро можно протестировать новую модель, сравнив ее с другими.

h2: Лайв-тест

Я взял слот Gates of Olympus и собрал по нему: RTP, максимальный выигрыш, механика, множители, фриспины, ставки. И дал задание 14 моделям (OpenAI от gpt-4o-mini до gpt-5.6, плюс китайские Kimi-K3, GLM-5.2, Qwen3.8) написать обзор слота двумя промптами: по памяти и с фактами внутри промпта.

h3: Результаты по памяти

gpt-5.4-mini перепутал механику: назвал «Pay Anywhere / Cluster» вместо Scatter Pays. Насчитал 6 номиналов множителей вместо 15, заявил, что бонуса нет (есть).

— gpt-5.6-sol выдумал номинал множителя 75x, которого в игре не существует, и hit frequency 27,27% (реальная 28,82%).

— gpt-4o-mini перепутал вообще все выплаты за скаттеры (5x/100x/500x вместо 3x/5x/100x).

— gpt-4.1-mini уверенно написал, что Ante Bet и Buy Feature «отсутствуют». Обе функции есть.

— gpt-5.4-nano выдал сетку 5×4 вместо 6×5.

Ноль галлюцинаций у gpt-4o, gpt-5, gpt-5.2, Kimi-K3 и Qwen3.8 — они либо знают точные цифры, либо честно пишут «нет данных». Отдельно отмечу Kimi-K3: китайская модель знает слоты не хуже топового OpenAI (25 верных фактов, ноль галлюцинаций).

h3: Результаты с фактами

Промпт с фактами внутри — обнулил галлюцинации у всех 14 моделей. Ноль. Включая тех, кто по памяти путал механику.

h2: Вывод

Имея пару промптов и базу фактов, вы за полчаса получаете объективный, воспроизводимый рейтинг любых моделей по своей теме. Вышла новая модель — добавили строчку в конфиг, прогнали, увидели ее место в рейтинге.

Про LLM-судью: где нужна смысловая оценка, берите gpt-5-mini.

Сколько стоит? Весь эксперимент — 14 моделей, два прогона, сотни проверок — обошелся меньше чем в доллар.

Как сравнивать промпты и модели LLM перед запуском конвейера?

Чо, как вам статья?

Материалы по теме

Подборка полезных тулзов для работы Помимо основного сетапа есть штуки поменьше, которые…
Подборка полезных тулзов для работыПомимо основного сетапа есть штуки поменьше, которые сильно помогают:⚫️ 2csv — ТГ-бот, выгрузка истории сообщений из канала с охватами, реакциями, решарами и комментами. Просто кидаешь ссылку на канал и лутаешь…
Временная пятиминутная почта вместо гмаил ✉️ Вчера в чате общались как человек…
Временная пятиминутная почта вместо гмаил ✉️ Вчера в чате общались как человек создает адс кабы на левые почти, а не гмаил. И вспомнил как еще несколько лет назад создавал адс кабы на почты, которые были сделаны на основе домена в клауде. …
🎲 Криптобиржа OKX ужесточила проверки транзакций, связанных с гемблингом Крупная криптобиржа OKX…
🎲 Криптобиржа OKX ужесточила проверки транзакций, связанных с гемблингомКрупная криптобиржа OKX (суточный объём торгов на спотовом рынке — до $1,7 млрд, входит в топ-10 крупнейших платформ), зарегистрированная на Сейшельских островах, ужесточила…

Вставить свои 5 копеек:

Awesome image
Awesome image Awesome image Awesome image Awesome image
Awesome image