中文

超越困惑度:字符分布签名与MDTA基准用于AI文本检测

计算与语言 2026-05-05 v1

摘要

训练无监督的AI文本检测方法主要依赖模型对数概率,通过如Binoculars和DNA-DetectLLM等方法实现强大的检测性能。然而,这些方法面临一个根本性的上限,因为模型通过RLHF被优化以产生类似人类的概率分布。我们引入一种基于字符分布签名的替代检测信号。我们提供理论基础,表明AI模型在大规模均衡语料库上训练后,接近全局字符模式,而人类则表现出领域专业化的分布,形成一个“分离之墙”,其中人类与AI之间的差异显著超过AI与AI之间的差异。为实现系统评估,我们构建了Models-Domains-Temperatures-Adversarial (MDTA)基准,包含642,274个提示对齐样本,涵盖4个模型、5个领域、3种温度设置和3种对抗策略,显著扩展了HC3数据集,加入了现代模型响应、温度变化和对抗增强。我们引入了字母分布得分(LD-Score),其与困惑度方法的相关性很低(r = 0.08-0.13)。当与DNA-DetectLLM、Binoculars和FastDetectGPT集成时,通过非线性分类器,LD-Score可实现AUROC和F1分数的一致性提升,在词汇约束放大检测信号的专业领域中提升尤为显著。MDTA数据集可在:https://huggingface.co/datasets/nsp909/MDTA 访问。

关键词

引用

@article{arxiv.2605.01647,
  title  = {Beyond Perplexity: Character Distribution Signatures and the MDTA Benchmark for AI Text Detection},
  author = {Priyadarshan Narayanasamy and Swastik Agrawal and Klint Faber and Fardina Fathmiul Alam},
  journal= {arXiv preprint arXiv:2605.01647},
  year   = {2026}
}

备注

11 figures, 10 tables, 24 pages, Under Review at COLM 2026