探究提示特定捷径在AI生成文本检测中的影响
计算与语言
2024-06-25 v1
摘要
AI生成文本(AIGT)检测器是针对来自人类和LLM的常见任务文本开发的。尽管合理的提示选择多样性丰富,但这些数据集通常是使用有限的提示数量构建的。提示变化的不足会引入提示特定的捷径特征,这些特征存在于使用所选提示收集的数据中,但不适用于其他提示。在本文中,我们分析了此类捷径在AIGT检测中的影响。我们提出了反馈基准的对抗指令列表优化(FAILOpt),这是一种搜索对AIGT检测器具有欺骗性指令的攻击,利用提示特定的捷径。FAILOpt有效地降低了目标检测器的检测性能,相当于基于对抗情境示例的其他攻击。我们还利用我们的方法来通过缓解捷径来增强检测器的鲁棒性。基于我们的发现,我们进一步使用由FAILOpt提示生成的数据增强训练分类器。增强后的分类器在生成模型、任务和攻击方面都表现出改进。我们的代码将在https://github.com/zxcvvxcz/FAILOpt上提供。
引用
@article{arxiv.2406.16275,
title = {Investigating the Influence of Prompt-Specific Shortcuts in AI Generated Text Detection},
author = {Choonghyun Park and Hyuhng Joon Kim and Junyeob Kim and Youna Kim and Taeuk Kim and Hyunsoo Cho and Hwiyeol Jo and Sang-goo Lee and Kang Min Yoo},
journal= {arXiv preprint arXiv:2406.16275},
year = {2024}
}
备注
19 pages, 3 figures, 13 tables, under review