Одну и ту же статью четыре детектора оценили в 6%, 47%, 74%…
Одну и ту же статью четыре детектора оценили в 6%, 47%, 74% и 94% машинности. Один текст, четыре ответа, и каждый выдан с точностью до процента.
Поэтому в своём детекторе я процент не показываю.
Вместо него — пять признаков, которые видно глазами и можно починить руками. Список через двоеточие там, где просится фраза. Тире вместо союза. Одинаковые зачины абзацев. Слишком ровный ритм. Отсутствие повторов даже там, где повтор уместен. По каждому признаку инструмент даёт значение, порог и цитаты мест, где он сработал.
Пороги я снял на 231 человеческой статье 2007–2021 годов и 360 машинных, написанных пятью моделями по трём режимам задания. Учились они на одних площадках, а проверялись на других, иначе проверка хвалит сама себя. Инструмент ловит 71% машинных SEO-текстов при 5% ложных срабатываний, а на коммерческих текстах 91%.
Два признака из пяти оказались перевёрнуты. Я считал, что машина повторяется чаще человека и пишет рвано. Всё наоборот. Ритм у неё ровнее, а трёхсловные сочетания она обходит там, где живой автор спокойно повторится.
Про слабые места я написал на той же странице. На художественной прозе инструмент ошибается в каждом пятом случае, на новостях в каждом восьмом, а короткие тексты и перечни судить отказывается совсем.
Ещё я прогнал его на 127 живых страницах Википедии и Хабра. Ложных срабатываний 5,3%.
Вставить свои 5 копеек: