人类文本是异常值:基于异常分布检测的 LLM 生成文本检测方法
计算与语言
2025-10-13 v1 机器学习
摘要
大语言模型(如 ChatGPT、DeepSeek、Claude)的快速发展显著增加了 AI 生成文本在数字通信中的存在。这一趋势加剧了对可靠检测方法的需求,以区分人类撰写与机器生成的内容。现有方法(零样本方法和监督分类器)大多将此任务概念化为二元分类问题,往往导致跨域和跨模型的泛化性能差。本文认为,这种二元表述从根本上错误地刻画了检测任务,因其假设人类撰写的文本构成统一的分布。实际上,人类文本并不构成统一分布,其多样性无法通过有限抽样有效捕获。这导致前述分类器记忆已观察到的异常分布特征,而非学习 `非-内部分布' 的本质,限制了对未见人类撰写输入的泛化能力。基于此观察,我们提出将检测任务重新表述为异常分布(OOD)检测问题,将人类撰写文本视为分布性异常值,而机器生成文本则视为内部分布(ID)样本。为此,我们开发了包含 DeepSVDD 和 HRN 的单类学习检测框架,以及能量基方法等评分学习技术,实现稳健且通用的检测性能。广泛实验表明,我们的 ODD 方法在 DeepFake 数据集上实现 98.3% 的 AUROC 和 AUPR,仅有 8.9% 的 FPR95。此外,我们在多语言、受攻击、未见模型和域设置下测试了检测框架,证明其稳健性与通用性。代码、预训练权重和演示将公开发布。
关键词
引用
@article{arxiv.2510.08602,
title = {Human Texts Are Outliers: Detecting LLM-generated Texts via Out-of-distribution Detection},
author = {Cong Zeng and Shengkun Tang and Yuanzhou Chen and Zhiqiang Shen and Wenchao Yu and Xujiang Zhao and Haifeng Chen and Wei Cheng and Zhiqiang Xu},
journal= {arXiv preprint arXiv:2510.08602},
year = {2025}
}