中文

穿越阴影:揭示现代AI内容检测器的有效扰动

计算与语言 2024-06-14 v1 人工智能 机器学习

摘要

随着ChatGPT的发布,大型语言模型(LLM)引起了全球关注。在文章写作领域,LLM得到了广泛应用,引发了与知识产权保护、个人隐私和学术诚信相关的担忧。为此,AI文本检测应运而生,以区分人类生成和机器生成的内容。然而,近期研究表明,这些检测系统通常缺乏鲁棒性,难以有效区分被扰动的文本。目前,缺乏对实际应用中检测性能的系统性评估,也缺少对扰动技术和检测器鲁棒性的全面考察。为弥补这一空白,我们的工作模拟了非正式和专业写作中的真实场景,探索了当前检测器的开箱即用性能。此外,我们构建了12种黑盒文本扰动方法,以评估当前检测模型在不同扰动粒度下的鲁棒性。进一步地,通过对抗学习实验,我们研究了扰动数据增强对AI文本检测器鲁棒性的影响。我们已在https://github.com/zhouying20/ai-text-detector-evaluation发布了代码和数据。

关键词

引用

@article{arxiv.2406.08922,
  title  = {Navigating the Shadows: Unveiling Effective Disturbances for Modern AI Content Detectors},
  author = {Ying Zhou and Ben He and Le Sun},
  journal= {arXiv preprint arXiv:2406.08922},
  year   = {2024}
}

备注

Accepted by ACL 2024, Main Conference