ESPERANTO:评估合成短语以增强 AI 文本溯源检测的鲁棒性
计算与语言
2024-09-24 v1 人工智能
摘要
尽管大语言模型(LLM)在各个领域展现出显著的实用性,但同时它们也容易被滥用于不道德目的,包括学术不端和虚假信息传播。因此,AI 生成文本检测系统应运而生作为应对措施。然而,这些检测机制表现出对规避技术的脆弱性,且缺乏对抗文本操纵的鲁棒性。本文引入回译作为一种规避检测的新技术,强调了增强当前检测系统鲁棒性的必要性。所提方法涉及将 AI 生成文本通过多种语言翻译后再回译至英语。我们提出了一个模型,将这些回译文本结合以生成原始 AI 生成文本的操纵版本。我们的发现表明,被操纵的文本保留了原始语义,同时显著降低了现有检测方法的真阳性率(TPR)。我们在九个 AI 检测器上评估了该技术,包括六个开源系统和三个专有系统,揭示了它们对回译操纵的易感性。针对现有 AI 文本检测器已识别的缺陷,我们提出了一种对策以提高对抗这种操纵形式的鲁棒性。我们的结果表明,所提方法的 TPR 在经过回译操纵后仅下降了 1.85%。此外,我们使用八个不同的 LLM 构建了一个包含 72 万条文本的大型数据集。我们的数据集包含各种领域和写作风格的人类撰写文本和 LLM 生成文本,以评估我们方法和现有检测器的性能。该数据集已公开共享,以造福研究社区。
引用
@article{arxiv.2409.14285,
title = {ESPERANTO: Evaluating Synthesized Phrases to Enhance Robustness in AI Detection for Text Origination},
author = {Navid Ayoobi and Lily Knab and Wen Cheng and David Pantoja and Hamidreza Alikhani and Sylvain Flamant and Jin Kim and Arjun Mukherjee},
journal= {arXiv preprint arXiv:2409.14285},
year = {2024}
}