抽样方式如何影响机器生成文本的可检测性:综合研究
计算与语言
2025-10-16 v1
摘要
随着大型语言模型(LLM)生成的文本越来越常见,常常与人类撰写的内容难以区分,针对自动文本检测的研究正获得越来越多的关注。许多最近的检测器报告接近完美的准确率,常以 AUROC 分数超过 99% 为卖点。然而,这些声称通常假设固定的生成设置,留下了这些系统在解码策略变化时鲁棒性的问题。本文系统性地考察了基于抽样的解码如何影响可检测性,重点关注模型(子)词级分布细微变化对检测性能的影响。我们发现,即使对解码参数进行微小调整——如温度、top-p 或核抽样——也会严重损害检测器的准确率,其中一些设置下 AUROC 可从接近完美的水平跌至 1%。我们的发现揭示了当前检测方法中的关键盲点,强调需要更全面的评估协议。为促进未来研究,我们发布了一个包含 37 种解码配置的大规模数据集,以及我们的代码和评估框架 https://github.com/BaggerOfWords/Sampling-and-Detection
引用
@article{arxiv.2510.13681,
title = {How Sampling Affects the Detectability of Machine-written texts: A Comprehensive Study},
author = {Matthieu Dubois and François Yvon and Pablo Piantanida},
journal= {arXiv preprint arXiv:2510.13681},
year = {2025}
}
备注
EMNLP 2025 Findings