中文

检测器混合:机器生成文本检测的紧凑视角

计算与语言 2025-09-29 v1

摘要

大语言模型正准备超越人类的创造力。这一论断的真实性需要审慎考量。在近期的发展中,出现了关于人类作品真实性以及其创造力与创新能力保留的关键问题。本文调查了此类问题。本文探讨了跨多种场景的机器生成文本检测,包括文档级二分类与多分类或生成器归因、区分人机协作文本的句子级分割,以及旨在降低机器生成文本可检测性的对抗攻击。我们引入了一项名为 BMAS English 的新工作:一个用于人类与机器文本二分类和多分类的英语数据集,它不仅能识别机器生成文本,还能尝试确定其生成器;还包括针对缓解检测常见行为的对抗攻击,以及用于预测人类与机器生成文本边界的句子级分割。我们相信本文将以更有意义的方式处理机器生成文本检测领域的先前工作。

关键词

引用

@article{arxiv.2509.22147,
  title  = {Mixture of Detectors: A Compact View of Machine-Generated Text Detection},
  author = {Sai Teja Lekkala and Yadagiri Annepaka and Arun Kumar Challa and Samatha Reddy Machireddy and Partha Pakray and Chukhu Chunka},
  journal= {arXiv preprint arXiv:2509.22147},
  year   = {2025}
}

备注

20 pages, 3 figures