中文

RAID:机器生成文本检测器的共享稳健基准

计算与语言 2024-06-11 v2

摘要

许多商业和开源模型声称能够以极高准确率(99% 以上)检测机器生成文本。然而,这些检测器很少在共享基准数据集上进行评估,且即使有共享数据集,所用的评估数据集也不够具有挑战性——缺乏采样策略的变化、对抗攻击以及开源生成模型的多样性。本文提出了 RAID:机器生成文本检测的最大且最具挑战性的基准数据集。RAID 包含超过 600 万次生成,涵盖 11 个模型、8 个领域、11 种对抗攻击和 4 种解码策略。使用 RAID,我们评估了 8 个开源和 4 个闭源检测器的跨域和对抗鲁棒性,发现当前检测器容易被对抗攻击、采样策略的变化、重复惩罚以及未见生成模型所欺骗。我们发布了数据集并设立了排行榜,以鼓励未来的研究。

关键词

引用

@article{arxiv.2405.07940,
  title  = {RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors},
  author = {Liam Dugan and Alyssa Hwang and Filip Trhlik and Josh Magnus Ludan and Andrew Zhu and Hainiu Xu and Daphne Ippolito and Chris Callison-Burch},
  journal= {arXiv preprint arXiv:2405.07940},
  year   = {2024}
}

备注

ACL 2024