Главная страница TG News Как сравнивать промпты и модели LLM перед запуском конвейера? В прошлый раз…

Как сравнивать промпты и модели LLM перед запуском конвейера? В прошлый раз…

Как сравнивать промпты и модели LLM перед запуском конвейера?

В прошлый раз разбирали как ловить плохую статью на выходе с помощью deepeval. Но можно ловить раньше: на самом промпте и модели, которой вы этот промпт скармливаете (спасибо, Кэп!). Инструмент для этого — бесплатный promptfoo (есть веб-версия на локалке и CLI).

Перечисляете промпты, модели и тесты с проверками, а promptfoo проверит их: каждый промпт * каждую модель * каждую проверку.

Проверки здесь двух видов, прям как в deepeval:
— Детерминированные: Проверяют, что в тексте есть нужное число, есть таблица и т.д. Это бесплатно.
— LLM-судья: Критерий пишется обычным текстом. Например: "верно ли передана механика?". Платим за токены.

С помощью promptfoo очень быстро можно протестировать новую модель, сравнив ее с другими.

h2: Лайв-тест

Я взял слот Gates of Olympus и собрал по нему: RTP, максимальный выигрыш, механика, множители, фриспины, ставки. И дал задание 14 моделям (OpenAI от gpt-4o-mini до gpt-5.6, плюс китайские Kimi-K3, GLM-5.2, Qwen3.8) написать обзор слота двумя промптами: по памяти и с фактами внутри промпта.

h3: Результаты по памяти

gpt-5.4-mini перепутал механику: назвал "Pay Anywhere / Cluster" вместо Scatter Pays. Насчитал 6 номиналов множителей вместо 15, заявил, что бонуса нет (есть).

— gpt-5.6-sol выдумал номинал множителя 75x, которого в игре не существует, и hit frequency 27,27% (реальная 28,82%).

— gpt-4o-mini перепутал вообще все выплаты за скаттеры (5x/100x/500x вместо 3x/5x/100x).

— gpt-4.1-mini уверенно написал, что Ante Bet и Buy Feature "отсутствуют". Обе функции есть.

— gpt-5.4-nano выдал сетку 5×4 вместо 6×5.

Ноль галлюцинаций у gpt-4o, gpt-5, gpt-5.2, Kimi-K3 и Qwen3.8 — они либо знают точные цифры, либо честно пишут "нет данных". Отдельно отмечу Kimi-K3: китайская модель знает слоты не хуже топового OpenAI (25 верных фактов, ноль галлюцинаций).

h3: Результаты с фактами

Промпт с фактами внутри — обнулил галлюцинации у всех 14 моделей. Ноль. Включая тех, кто по памяти путал механику.

h2: Вывод

Имея пару промптов и базу фактов, вы за полчаса получаете объективный, воспроизводимый рейтинг любых моделей по своей теме. Вышла новая модель — добавили строчку в конфиг, прогнали, увидели ее место в рейтинге.

Про LLM-судью: где нужна смысловая оценка, берите gpt-5-mini.

Сколько стоит? Весь эксперимент — 14 моделей, два прогона, сотни проверок — обошелся меньше чем в доллар.

Как сравнивать промпты и модели LLM перед запуском конвейера? В прошлый раз…

Чо, как вам статья?

Материалы по теме

Наткнулся на занятную штуку, одно время было довольно популярно делать llms.txt с…
Наткнулся на занятную штуку, одно время было довольно популярно делать llms.txt с инструкциями для АИ ботов которые в 98% никто не читал - тыц. Как же я, мягко сказать, "удивился" увидев как чел загоняет эти файлы в индекс ботов (прочитать…
ПРОЦЕНТ ЗАПУСКА, КЛОАКИНГ, КОМПРОМИС, ПРЕПЕИ 300 НА ЮТУБ + КМС, РЕ-РЕВЬЮ, ДРУГИЕ…
ПРОЦЕНТ ЗАПУСКА, КЛОАКИНГ, КОМПРОМИС, ПРЕПЕИ 300 НА ЮТУБ + КМС, РЕ-РЕВЬЮ, ДРУГИЕ ИСТОЧНИКИ. С последнего поста прошло 3 недели, пора рассказать что происходило и что нового произошло. Клоакинг стал лететь практически на все плейсменты, и я уже не…
Press Gazette: статьи на поддельных сайтах Forbes предлагают в сети по $10…
Press Gazette: статьи на поддельных сайтах Forbes предлагают в сети по $10 000Издание выпустило расследование про два сайта, Forbes LA и Forbes Liechtenstein. Forbes подтвердил Press Gazette, что обе площадки поддельные, и заявил, что принимает…

Вставить свои 5 копеек:

Awesome image
Awesome image Awesome image Awesome image Awesome image
Awesome image