中文

TempTest:局部归一化失真与机器生成文本的检测

计算与语言 2025-03-27 v1 机器学习 动力系统

摘要

现有的零样本机器生成文本检测方法主要依赖三种统计量:对数似然、对数秩和熵。随着语言模型对人类文本分布的模拟越来越精确,这将限制我们构建有效检测算法的能力。为此,我们提出一种完全独立于生成语言模型的机器生成文本检测方法。该方法通过针对解码策略(如温度或 top-k 采样)对条件概率度量进行归一化的方式中的缺陷进行检测,从而实现模型无关性。这一方法可在理论上严格归正,易于解释,且概念上与现有的机器生成文本检测方法具有根本区别。我们在白盒和黑盒设置下,对 various 语言模型、数据集和段落长度进行评估。还研究了 paraphrase 攻击对检测器的影响以及其对非母语者的偏见程度。在所有这些设置下,该检测器的性能至少与其他最先进文本检测器相当,在某些情况下显著优于这些基线方法。

关键词

引用

@article{arxiv.2503.20421,
  title  = {TempTest: Local Normalization Distortion and the Detection of Machine-generated Text},
  author = {Tom Kempton and Stuart Burrell and Connor Cheverall},
  journal= {arXiv preprint arXiv:2503.20421},
  year   = {2025}
}