Главная страница TG News Как сравнивать промпты и модели LLM перед запуском конвейера?

Как сравнивать промпты и модели LLM перед запуском конвейера?

В прошлый раз разбирали как ловить плохую статью на выходе с помощью deepeval. Но можно ловить раньше: на самом промпте и модели, которой вы этот промпт скармливаете (спасибо, Кэп!). Инструмент для этого — бесплатный promptfoo (есть веб-версия на локалке и CLI).

Перечисляете промпты, модели и тесты с проверками, а promptfoo проверит их: каждый промпт * каждую модель * каждую проверку.

Проверки здесь двух видов, прям как в deepeval:
— Детерминированные: Проверяют, что в тексте есть нужное число, есть таблица и т.д. Это бесплатно.
— LLM-судья: Критерий пишется обычным текстом. Например: «верно ли передана механика?». Платим за токены.

С помощью promptfoo очень быстро можно протестировать новую модель, сравнив ее с другими.

h2: Лайв-тест

Я взял слот Gates of Olympus и собрал по нему: RTP, максимальный выигрыш, механика, множители, фриспины, ставки. И дал задание 14 моделям (OpenAI от gpt-4o-mini до gpt-5.6, плюс китайские Kimi-K3, GLM-5.2, Qwen3.8) написать обзор слота двумя промптами: по памяти и с фактами внутри промпта.

h3: Результаты по памяти

gpt-5.4-mini перепутал механику: назвал «Pay Anywhere / Cluster» вместо Scatter Pays. Насчитал 6 номиналов множителей вместо 15, заявил, что бонуса нет (есть).

— gpt-5.6-sol выдумал номинал множителя 75x, которого в игре не существует, и hit frequency 27,27% (реальная 28,82%).

— gpt-4o-mini перепутал вообще все выплаты за скаттеры (5x/100x/500x вместо 3x/5x/100x).

— gpt-4.1-mini уверенно написал, что Ante Bet и Buy Feature «отсутствуют». Обе функции есть.

— gpt-5.4-nano выдал сетку 5×4 вместо 6×5.

Ноль галлюцинаций у gpt-4o, gpt-5, gpt-5.2, Kimi-K3 и Qwen3.8 — они либо знают точные цифры, либо честно пишут «нет данных». Отдельно отмечу Kimi-K3: китайская модель знает слоты не хуже топового OpenAI (25 верных фактов, ноль галлюцинаций).

h3: Результаты с фактами

Промпт с фактами внутри — обнулил галлюцинации у всех 14 моделей. Ноль. Включая тех, кто по памяти путал механику.

h2: Вывод

Имея пару промптов и базу фактов, вы за полчаса получаете объективный, воспроизводимый рейтинг любых моделей по своей теме. Вышла новая модель — добавили строчку в конфиг, прогнали, увидели ее место в рейтинге.

Про LLM-судью: где нужна смысловая оценка, берите gpt-5-mini.

Сколько стоит? Весь эксперимент — 14 моделей, два прогона, сотни проверок — обошелся меньше чем в доллар.

Как сравнивать промпты и модели LLM перед запуском конвейера?

Чо, как вам статья?

Материалы по теме

Про регистрацию в .mx
Недавно у меня спросили можно ли регистрировать в .mx домены на нерезидента. Если в кратце, то да В принципе в Европе и uk выбираешь регистратор и просто регаешь на выдуманные доки похожие на реального человека, в латаме тоже самое. Главное не…
Наткнулся на занятную штуку, одно время было довольно популярно делать llms.txt с…
Наткнулся на занятную штуку, одно время было довольно популярно делать llms.txt с инструкциями для АИ ботов которые в 98% никто не читал - тыц. Как же я, мягко сказать, "удивился" увидев как чел загоняет эти файлы в индекс ботов (прочитать…
Процент запуска, клоакинг, компромис, препеи 300 на ютуб + кмс, ре-ревью, другие источники
С последнего поста прошло 3 недели, пора рассказать что происходило и что нового произошло. Клоакинг стал лететь практически на все плейсменты, и я уже не уверен, что это вайты. (Раньше ютуб и кмс из деманд гена запускались легко) Пробовал разные…

Вставить свои 5 копеек:

Awesome image
Awesome image Awesome image Awesome image Awesome image
Awesome image