Glimpse:使白盒方法能够使用专有模型进行零样本LLM生成文本检测
计算与语言
2025-02-20 v2 人工智能
摘要
先进的大语言模型(LLM)能够生成几乎与人类书写文本无法区分的文本,凸显了LLM生成文本检测的重要性。然而,当前的零样本技术面临挑战:白盒方法仅限于使用较弱的开源LLM,而黑盒方法则受限于对更强专有LLM的部分观测。由于API级别的模型访问既不提供完整的预测分布,也不提供内部嵌入,因此使白盒方法能够使用专有模型似乎是不可能的。为了跨越这一鸿沟,我们提出了**Glimpse**,一种概率分布估计方法,从部分观测中预测完整分布。尽管Glimpse简单,但我们成功地将白盒方法(如Entropy、Rank、Log-Rank和Fast-DetectGPT)扩展到最新的专有模型。实验表明,使用Fast-DetectGPT和GPT-3.5的Glimpse在五个最新源模型上实现了约0.95的平均AUROC,相对于开源基线的剩余空间提高了51%的分数。这表明最新的LLM可以有效检测自身的输出,提示先进的LLM可能是对抗自身的最佳盾牌。我们在https://github.com/baoguangsheng/glimpse 发布了代码和数据。
引用
@article{arxiv.2412.11506,
title = {Glimpse: Enabling White-Box Methods to Use Proprietary Models for Zero-Shot LLM-Generated Text Detection},
author = {Guangsheng Bao and Yanbin Zhao and Juncai He and Yue Zhang},
journal= {arXiv preprint arXiv:2412.11506},
year = {2025}
}
备注
ICLR 2025 camera version (10 pages, 9 figures, 9 tables)