以毒反毒:通过对抗训练提升少样本机器生成文本检测的鲁棒性
密码学与安全
2026-05-05 v1 计算与语言
摘要
机器生成文本(MGT)检测是调控在线信息生态系统中至关重要的任务,但现有检测器在少样本设置下往往表现不佳,且易受对抗性的人类化攻击而不稳健。为在监督信息有限的情况下构建精准且稳健的检测器,我们采用威胁建模的视角,从攻击者的角度在仅能访问输出的黑箱环境下研究检测器的脆弱性。鼓励此视角,我们提出了一种名为 REACT(RAG-GuidEd Attacker Strengthens ConTrastive Few-shot Detector)的对抗训练框架,用于提高少样本检测性能和抗攻击鲁棒性。REACT 将一种以人类化为导向的攻击者与目标检测器耦合:攻击者利用检索增强生成(RAG) crafting 高度类似人类的对抗样本以规避检测,而检测器则通过对比目标函数从这些对手学习,以稳定少样本表征学习并提升鲁棒性。我们交替更新攻击者和检测器,以实现其共演化。在4个数据集上进行实验,分别使用4种 shot 大小和3个随机种子,结果表明 REACT 在8个最先进(SOTA)检测器的平均检测 F1 分数上提升了4.95分,同时将在4种强大攻击下的平均攻击成功率(ASR)降低了3.66个百分点。
引用
@article{arxiv.2605.02374,
title = {Fight Poison with Poison: Enhancing Robustness in Few-shot Machine-Generated Text Detection with Adversarial Training},
author = {Wenjing Duan and Qi Zhou and Yuanfan Li},
journal= {arXiv preprint arXiv:2605.02374},
year = {2026}
}