基于隐式奖励模型的零样态 LLM 生成文本检测
计算与语言
2026-04-24 v1 人工智能
摘要
大语言模型(LLM)在各类任务中展现出惊人的能力,但其生成类人文本的能力引发了潜在滥用的担忧。这凸显了可靠且有效检测 LLM 生成文本的方法的需求。本文提出 IRM,一种新颖的零样态方法,利用隐式奖励模型进行 LLM 生成文本检测。此类隐式奖励模型可从公开可用的指令调优模型和基础模型中推导得出。 previous reward-based 方法依赖偏好构建和任务特定的微调,与之相比,IRM 无需收集偏好也无需额外训练。我们在 DetectRL 数据集上评估 IRM,证明 IRM 能实现优越的检测性能,在 LLM 生成文本检测方面超越了现有的零样态和监督方法。
引用
@article{arxiv.2604.21223,
title = {Zero-Shot Detection of LLM-Generated Text via Implicit Reward Model},
author = {Runheng Liu and Heyan Huang and Xingchen Xiao and Zhijing Wu},
journal= {arXiv preprint arXiv:2604.21223},
year = {2026}
}
备注
NeurIPS 2025