中文

GigaCheck:通过以对象为中心的片段定位检测大语言模型生成内容

计算与语言 2026-04-15 v3

摘要

随着大语言模型(LLM)助手质量的提升和普及,生成内容的数量正在快速增长。在许多场景和任务中,此类文本已难以与人类撰写的文本区分,且生成质量仍在持续提高。与此同时,检测方法的发展速度慢于生成模型,这使得防止生成式人工智能技术的滥用变得颇具挑战。我们提出 GigaCheck,一个用于AI生成文本检测的双策略框架。在文档层面,我们利用微调后LLM的表示学习,以高数据效率辨别作者身份。在片段层面,我们引入一种新颖的结构性适配方法,将生成的文本片段视为“对象”。通过将类似DETR的视觉模型与语言编码器相结合,我们实现了对AI生成区间的精确定位,有效地将视觉对象检测的鲁棒性迁移到文本领域。在三个分类和三个定位基准上的实验结果证实了我们方法的鲁棒性。共享的微调骨干网络在两种场景下均提供了强大的准确性,突显了所学嵌入的泛化能力。此外,我们成功证明了像DETR这样的视觉检测架构不仅限于像素空间,能够有效地泛化到生成文本片段的定位。为确保可复现性并促进进一步研究,我们公开了源代码。

关键词

引用

@article{arxiv.2410.23728,
  title  = {GigaCheck: Detecting LLM-generated Content via Object-Centric Span Localization},
  author = {Irina Tolstykh and Aleksandra Tsybina and Sergey Yakubson and Aleksandr Gordeev and Vladimir Dokholyan and Maksim Kuprashevich},
  journal= {arXiv preprint arXiv:2410.23728},
  year   = {2026}
}

备注

Accepted to Findings of the Association for Computational Linguistics: ACL 2026