AdaDetectGPT:具有统计保证的 LLM 生成文本自适应检测
计算与语言
2026-02-03 v5 人工智能
机器学习
机器学习
摘要
我们研究判断一段文本是由人类还是由大型语言模型(LLM)撰写的问题。现有最先进的基于 logits 的检测器利用从使用给定源 LLM 的分布函数评估的观测文本的对数概率中得出的统计量。然而,仅依赖对数概率可能次优。作为回应,我们引入了 AdaDetectGPT——一种新型分类器,它从训练数据中自适应地学习一个见证函数,以增强基于 logits 的检测器的性能。我们对其真正阳性率、假阳性率、真阴性率和假阴性率提供了统计保证。广泛的数值研究表明,AdaDetectGPT 在各种数据集和 LLM 组合中几乎一致地改进了最先进方法,提升幅度可达 37%。我们方法的 Python 实现可在 https://github.com/Mamba413/AdaDetectGPT 获取。
引用
@article{arxiv.2510.01268,
title = {AdaDetectGPT: Adaptive Detection of LLM-Generated Text with Statistical Guarantees},
author = {Hongyi Zhou and Jin Zhu and Pingfan Su and Kai Ye and Ying Yang and Shakeel A O B Gavioli-Akilagun and Chengchun Shi},
journal= {arXiv preprint arXiv:2510.01268},
year = {2026}
}
备注
Accepted by NeurIPS2025