中文

DivScore:专业领域 LLM 生成文本的零样本检测

计算与语言 2025-06-10 v1 人工智能

摘要

检测 LLM 生成文本在专业和高风险领域(如医疗和法律)中的真实性对于抵御误information and 确保真实性至关重要。然而,当前的零样本检测器在一般文本上有效,但常常在专业内容上难以应用,因为存在领域偏移。我们提供了理论分析,表明这种失败本质上与人类、检测器和源文本分布之间的 KL 散度有关。为此,我们提出了 DivScore,一种使用归一化熵基 scoring 和领域知识蒸馏的零样本检测框架,用于稳健地识别专业领域中的 LLM 生成文本。我们也发布了一个针对医疗和法律领域的 LLM 生成文本检测的领域特定基准。在我们的基准上实验表明,DivScore 在所有基于 SOTA 检测器之上均表现出色,AUROC 提高了 14.4%,召回率提高了 64.0%(0.1% 假阳性率阈值)。在对抗性情境下,DivScore 比其他基线方法表现出更好的鲁棒性,AUROC 平均提高 22.8%,召回率提高 29.5%。代码和数据已公开。

关键词

引用

@article{arxiv.2506.06705,
  title  = {DivScore: Zero-Shot Detection of LLM-Generated Text in Specialized Domains},
  author = {Zhihui Chen and Kai He and Yucheng Huang and Yunxiao Zhu and Mengling Feng},
  journal= {arXiv preprint arXiv:2506.06705},
  year   = {2025}
}

备注

Zhihui Chen and Kai He contributed equally to this work, Mengling Feng is the corresponding author