DAMAGE:检测对抗性修改的 AI 生成文本
计算与语言
2025-01-08 v1
摘要
AI 人性化工具是一类新的在线软件工具,旨在通过改写和重写 AI 生成的文本,使其能够逃避 AI 检测软件。我们研究了 19 种 AI 人性化工具和改写工具,并定性评估了它们在保留原文含义方面的效果和忠实度。我们表明,许多现有的 AI 检测器无法检测出人性化处理后的文本。最后,我们展示了一个稳健的模型,该模型使用以数据为中心的增强方法,能够在保持低误报率的同时检测出人性化处理后的 AI 文本。我们攻击了自己的检测器,训练了一个针对我们检测器的预测进行优化的微调模型,并表明我们的检测器跨人性化工具的泛化能力足以对此类攻击保持稳健。
引用
@article{arxiv.2501.03437,
title = {DAMAGE: Detecting Adversarially Modified AI Generated Text},
author = {Elyas Masrour and Bradley Emi and Max Spero},
journal= {arXiv preprint arXiv:2501.03437},
year = {2025}
}