类人文本是否受人类青睐?多语言人类检测与对 AI 文本的偏好
计算与语言
2026-04-30 v3 人工智能
摘要
先前研究表明,区分大语言模型 (LLM) 生成的文本与人类撰写的文本在人类眼中几乎难以分辨,往往不如随机猜测。为验证这一发现在不同语言和领域中的普遍性,本文进行大规模案例研究,以识别人类检测准确率的上限。跨越 16 个数据集、9 种语言和 9 个领域,19 名标注员实现了平均检测准确率为 87.6%,这挑战了之前的结论。我们发现,人类文本与机器文本之间的主要差异体现在具体性、文化细微差别和多样性方面。通过在提示词中显式解释这些区别进行引导,可在超过 50% 的情况下部分弥合这些差距。然而,我们也发现人类并不总是偏好人类撰写的文本,尤其是在他们无法明确识别其来源时。我们在 https://github.com/xnlp-lab/HumanEval-MGT 上发布了数据集、人类标签以及标注员元数据。
引用
@article{arxiv.2502.11614,
title = {Is Human-Like Text Liked by Humans? Multilingual Human Detection and Preference Against AI},
author = {Yuxia Wang and Rui Xing and Jonibek Mansurov and Giovanni Puccetti and Zhuohan Xie and Minh Ngoc Ta and Jiahui Geng and Jinyan Su and Mervat Abassy and Saad El Dine Ahmed and Kareem Elozeiri and Nurkhan Laiyk and Maiya Goloburda and Tarek Mahmoud and Raj Vardhan Tomar and Alexander Aziz and Ryuto Koike and Masahiro Kaneko and Artem Shelmanov and Ekaterina Artemova and Vladislav Mikhailov and Akim Tsvigun and Alham Fikri Aji and Nizar Habash and Iryna Gurevych and Preslav Nakov},
journal= {arXiv preprint arXiv:2502.11614},
year = {2026}
}
备注
ACL 2026 Main