AI 生成文本检测器对对抗性扰动是否鲁棒?
计算与语言
2024-06-27 v2 人工智能
摘要
大型语言模型的广泛使用引发了人们对 AI 生成文本潜在滥用的担忧,因为这些模型可以生成与人类生成文本非常相似的内容。当前的 AI 生成文本检测器缺乏对抗性扰动的鲁棒性,即使是字符或单词的微小变化也会导致区分人类创作和 AI 生成文本的结果发生逆转。本文研究了现有 AIGT 检测方法的鲁棒性,并介绍了一种新颖的检测器——孪生校准重构网络(SCRN)。SCRN 采用重构网络为文本添加和去除噪声,提取对局部扰动鲁棒的语义表示。我们还提出了一种孪生校准技术来训练模型,使其在不同噪声下做出同等置信度的预测,这提高了模型对对抗性扰动的鲁棒性。在四个公开数据集上的实验表明,SCRN 优于所有基线方法,在对抗性攻击下,其绝对准确率比最佳基线方法提高了 6.5%-18.25%。此外,它在跨领域、跨体裁和混合来源场景中表现出优越的泛化能力。代码可在 \url{https://github.com/CarlanLark/Robust-AIGC-Detector} 获取。
引用
@article{arxiv.2406.01179,
title = {Are AI-Generated Text Detectors Robust to Adversarial Perturbations?},
author = {Guanhua Huang and Yuchen Zhang and Zhe Li and Yongjian You and Mingze Wang and Zhouwang Yang},
journal= {arXiv preprint arXiv:2406.01179},
year = {2024}
}
备注
Accepted to ACL 2024 main conference