您的语言模型能秘密模仿人类写作:针对 LLM 生成文本检测器的对抗性改写攻击
计算与语言
2025-09-11 v3 人工智能
摘要
大语言模型(LLM)的滥用(如学术抄袭)推动了开发检测器以识别 LLM 生成的文本。为规避这些检测器,已出现改写攻击,旨在有意重写这些文本以规避检测。尽管成功,但现有方法需要大量数据和计算资源来训练专门的改写器,且在面对先进检测算法时攻击效果大幅降低。为此,我们提出 **Co**ntrastive **P**araphrase **A**ttack(CoPA),一种无训练方法,通过无需训练的 LLM 有效欺骗文本检测器。第一步是精心设计指令,鼓励 LLM 产生更类似人类的文本。尽管如此,我们观察到 LLM 本身的统计偏差仍会导致部分生成文本携带某些机器特征,能被检测器捕捉。为克服此问题,CoPA 构建一个作为人类文本分布对比的辅助机器文本分布。通过在解码过程中从人类文本分布中减去机器模式,CoPA 能够生成更难被文本检测器区分的句子。我们的理论分析表明,所提出方法具有优势。大量实验验证了 CoPA 在各种情景下欺骗文本检测器的有效性。
引用
@article{arxiv.2505.15337,
title = {Your Language Model Can Secretly Write Like Humans: Contrastive Paraphrase Attacks on LLM-Generated Text Detectors},
author = {Hao Fang and Jiawei Kong and Tianqu Zhuang and Yixiang Qiu and Kuofeng Gao and Bin Chen and Shu-Tao Xia and Yaowei Wang and Min Zhang},
journal= {arXiv preprint arXiv:2505.15337},
year = {2025}
}
备注
Accepted by EMNLP-2025