对数似然、辛普森悖论与机器生成文本检测
计算与语言
2026-05-08 v1 人工智能
机器学习
摘要
可靠地区分人类撰写文本与大语言模型生成文本的能力具有深远的社会重要性。该问题的主流方法利用了似然假设:机器生成文本在检测器语言模型中应显得比人类撰写文本更具概率性。然而,我们证明了区分人类与机器文本的 token 级信号在检测器模型的隐藏空间中分布并不均匀,而大多数检测器简单地在具有根本不同统计结构的区域间平均基于似然的 token 分数,这会导致一种辛普森悖论:强烈的局部信号被不当聚合所破坏。为纠正此问题,我们引入了基于贝叶斯决策理论的学习型局部校准步骤。我们不再聚合原始 token 分数,而是首先学习以隐藏空间位置为条件的分数分布的轻量级预测器,并聚合校准后的对数似然比。这一单一干预在我们考虑的所有基线检测器和所有数据集上均显著且一致地提升了检测性能。例如,我们校准后的 Fast-DetectGPT 变体在 GPT-5.4 文本上将 AUROC 从 提升至 ,而我们引入的局部校准 DMAP 检测器在各方面均实现了 SOTA 性能。尽管如此,我们的核心贡献并非提出一种新检测器,而是对现有检测器性能不佳的一个重要原因进行精确诊断,并提供一种有原则的、模块化的、与任何 token 平均流程兼容的补救措施。这将作为社区后续研究的基础,自然的发展方向包括更丰富的分布模型、改进的校准策略,以及通过完整贝叶斯最优决策规则实现隐藏空间几何信号的有原则集成。
引用
@article{arxiv.2605.06294,
title = {Log-Likelihood, Simpson's Paradox, and the Detection of Machine-Generated Text},
author = {Tom Kempton and Viktor Drobnyi and Maeve Madigan and Stuart Burrell},
journal= {arXiv preprint arXiv:2605.06294},
year = {2026}
}
备注
10 pages, 3 figures, 2 tables, 11 appendices