基于广义 Jensen-Shannon 散度的 LLM 生成文本黑箱检测
机器学习
2026-05-12 v2 信息论
math.IT
摘要
我们研究在实际约束下的机器生成文本黑箱检测问题:评分模型(代理语言模型)可能与未知源模型不匹配,按输入对比生成成本较高。我们提出了 SurpMark,这是一种基于参考的检测器,通过其 token surprisal 动力学来概括段落。SurpMark 将 surprisal 离散化为可解释的状态,估计测试文本的状态转移矩阵,并通过测试转移与两个固定参考(人类 vs. 机器)之间的广义 Jensen-Shannon (GJS) 差距进行评分。这两个参考数据构建于现有语料库。理论上,我们推导了离散化 bin 如何随数据规模而扩展的设计指导,并为测试统计量提供了原则性依据。实验上,跨多个数据集、源模型和场景,SurpMark 均表现出与基线相当或更好的鲁棒性,显示出强大的跨域和跨生成器鲁棒性;我们对超参数敏感性的实验显示出一系列趋势,这些理论结果有助于解释。
引用
@article{arxiv.2510.07500,
title = {Black-Box Detection of LLM-Generated Text Using Generalized Jensen-Shannon Divergence},
author = {Shuangyi Chen and Ashish Khisti},
journal= {arXiv preprint arXiv:2510.07500},
year = {2026}
}
备注
ICML 2026