SilverSpeak:使用同形字规避 AI 生成文本检测器
计算与语言
2025-01-22 v3 人工智能
摘要
大型语言模型(LLM)的出现使生成的文本越来越呈现出人类的特征。由于检测此类内容的重要性,大量研究致力于开发可靠的AI生成文本检测器。这些检测器在测试数据上表现出色,但最近的研究表明它们可以通过不同技术被规避。本文提出了基于同形字的攻击(A → Cyrillic A)作为规避现有检测器的手段。我们对这些攻击在七个检测器(包括 ArguGPT、Binoculars、DetectGPT、Fast-DetectGPT、Ghostbuster、OpenAI 的检测器以及水印技术)上的有效性进行了全面评估,这些检测器在五个不同的数据集上进行了测试。我们的发现表明,基于同形字的攻击能够有效规避前沿检测器,导致它们将所有文本分类为AI生成或人类撰写(将平均 Matthews Correlation Coefficient 从 0.64 降至 -0.01)。通过进一步检查,我们提取了这些攻击成功背后的技术依据,这些依据在不同检测器之间存在差异。最后,我们讨论了这些发现的意义以及可能的防御措施。
引用
@article{arxiv.2406.11239,
title = {SilverSpeak: Evading AI-Generated Text Detectors using Homoglyphs},
author = {Aldan Creo and Shushanta Pudasaini},
journal= {arXiv preprint arXiv:2406.11239},
year = {2025}
}
备注
Workshop on Detecting AI Generated Content at COLING 2025