生成式 Transformer 检测中神经-统计特征的对抗鲁棒性
计算与语言
2022-10-05 v1 人工智能
机器学习
摘要
随着新兴生成模型能够高效生成逼真的类人文本,计算机生成文本的检测成为一个意义迅速增长的领域,此类文本可能被滥用于垃圾邮件、虚假信息、钓鱼或在线影响活动。过去的工作研究了当前最先进模型的检测,但尽管威胁态势不断发展,关于检测方法对对抗攻击鲁棒性的分析却极少。为此,我们评估了神经与非神经方法在检测计算机生成文本、对文本对抗攻击的鲁棒性,以及成功对抗攻击对人类文本质量判断影响方面的能力。我们发现,尽管统计特征表现不如神经特征,但其提供了额外的对抗鲁棒性,可用于集成检测模型中。在此过程中,我们发现以往对计算机生成文本检测有效的复杂短语特征对当代生成模型几乎无预测力,并识别出可替代的有前景统计特征。最后,我们开创性地将 MAUVE 用作对抗文本质量人类判断的代理度量。
引用
@article{arxiv.2203.07983,
title = {Adversarial Robustness of Neural-Statistical Features in Detection of Generative Transformers},
author = {Evan Crothers and Nathalie Japkowicz and Herna Viktor and Paula Branco},
journal= {arXiv preprint arXiv:2203.07983},
year = {2022}
}