DNA-DetectLLM:基于DNA突变-修复范式揭示AI生成文本
计算与语言
2025-10-10 v2
摘要
大型语言模型(LLM)的快速发展模糊了AI生成文本与人类撰写文本之间的界限。这种进展带来了误导信息、作者身份模糊以及知识产权 concerns 等社会风险,凸显了可靠AI生成文本检测方法的紧迫需求。然而,近期的生成式语言建模进展导致人类撰写文本和AI生成文本的特征分布之间出现显著重叠,模糊了分类边界,使得准确检测日益具有挑战性。为解决上述问题,我们提出一种基于DNA的视角,利用修复机制直接且可解释地捕捉人类撰写文本与AI生成文本的内在差异。基于此视角,我们引入DNA-DetectLLM,一种用于区分AI生成文本与人类撰写文本的零样本检测方法。该方法为每个输入构建理想的AI生成序列,通过迭代修复非最优标记,并将累积修复 effort 作为可解释的检测信号。经验评估表明,我们的方法在检测性能方面实现了状态突破,同时对各种对抗攻击和输入长度具有强大的鲁棒性。具体而言,DNA-DetectLLM 在多个公开基准数据集上实现了5.55% 的 AUROC 提升和2.08% 的 F1 分数提升。代码和数据已公开。
引用
@article{arxiv.2509.15550,
title = {DNA-DetectLLM: Unveiling AI-Generated Text via a DNA-Inspired Mutation-Repair Paradigm},
author = {Xiaowei Zhu and Yubing Ren and Fang Fang and Qingfeng Tan and Shi Wang and Yanan Cao},
journal= {arXiv preprint arXiv:2509.15550},
year = {2025}
}
备注
NeurIPS 2025 Spotlight