中文

一箭双雕:基于动态扰动的通用且鲁健的人工智能生成文本检测

计算与语言 2025-07-28 v2 人工智能

摘要

大型语言模型的流行使人们担忧其生成文本的潜在滥用。建立具备高泛化性和鲁健性的人工智能生成文本(AIGT)检测方法日益紧迫。然而,现有方法要么关注模型的泛化性,要么聚焦鲁健性,缺乏统一机制同时应对两者挑战。本文认为鲁健可视为特定形式的域迁移,实证揭示了AIGT检测任务中模型泛化的内在机制。随后,我们提出一种新型AIGT检测方法(DP-Net),通过强化学习引入动态扰动。该方法采用精心设计的奖励函数和动作空间。实验表明,DP-Net 在三个跨域场景中显著优于当前SOTA AIGT检测方法,具备更强的泛化能力;在两种文本对抗攻击下,DP-Net亦实现最佳鲁健性。代码已公开于 https://github.com/CAU-ISS-Lab/AIGT-Detection-Evade-Detection/tree/main/DP-Net。

关键词

引用

@article{arxiv.2504.21019,
  title  = {Kill two birds with one stone: generalized and robust AI-generated text detection via dynamic perturbations},
  author = {Yinghan Zhou and Juan Wen and Wanli Peng and Yiming Xue and Ziwei Zhang and Zhengxian Wu},
  journal= {arXiv preprint arXiv:2504.21019},
  year   = {2025}
}

备注

Accepted by NAACL 2025 main conference