Z.ai опубликовала инженерный отчет о том, как модель GLM-5.3 участвовала в создании…
Z.ai опубликовала инженерный отчет о том, как модель GLM-5.3 участвовала в создании production-инференса для GLM-5.3-Flash
Они описывают этот процесс как первый шаг в сторону recursive self-improvement и говорят, что подобная практика «полностью меняет то, как создаются следующие поколения моделей».
Короче, перед инженерами стояла задача: нужно было развернуть кластер на 100 000+ китайских ускорителей (не Nvidia). Это, кстати, первое развертывание их отечественных чипов такого масштаба.
GLM-5.3 использовали для оптимизации производительности и скорости. В итоге всего за две недели инженеры с помощью модели вырастили throughput в три раза!
Агент сам формулировал гипотезы, где теряется скорость, и писал код фиксов, люди только ставили цели, смотрели за безопасностью и принимали конечные решения.
Три конкретных фикса, которые агент сделал автономно:
– Убрал Python GIL bottleneck, который ел ~20% производительности
– Ускорил decode-кернел в 1.71 раза
– Починил числовую точность в KDA-кернеле для длинного контекста (фикс впоследствии влили в проект Flash Linear Attention)
https://z.ai/blog/glm-built-its-inference-infrastructure
P.S. В конце их блогпоста не хватает только фразы «а американцы пусть и дальше замедляются»
Материалы по теме
✍️ Как я коконы на WordPress вертел Вчера выпала мне нужда прилепить…
Казахстанская торговая площадка ITS запустила рынок прогнозов 8 сентября ITS, которая работает…
Вставить свои 5 копеек: