DetectGPT 是否充分利用了扰动?将选择性扰动桥接至微调的对比学习检测器会更好
计算与语言
2024-07-09 v4
摘要
大型语言模型(LLM)迅速崛起的生成能力引发了人们对滥用的日益担忧,这要求具备自动的机器生成文本检测器。DetectGPT 是一种零样本的基于指标的检测器,它首次引入了扰动并展现出巨大的性能提升。然而,在 DetectGPT 中,随机扰动策略可能会引入噪声,且 logit 回归依赖于阈值,这损害了单条或小批量输入的泛化能力和适用性。因此,我们提出了一种新颖的微调检测器 Pecola,通过对选择性扰动进行对比学习,将基于指标的方法和微调方法桥接起来。选择性策略在扰动过程中保留重要 token,并为多对对比学习进行加权。实验表明,Pecola 在四个公开数据集上的平均准确率比现有技术(SOTA)高出 1.20%。我们进一步分析了该方法的有效性、鲁棒性和泛化能力。
引用
@article{arxiv.2402.00263,
title = {Does DetectGPT Fully Utilize Perturbation? Bridging Selective Perturbation to Fine-tuned Contrastive Learning Detector would be Better},
author = {Shengchao Liu and Xiaoming Liu and Yichen Wang and Zehua Cheng and Chengzhengxu Li and Zhaohan Zhang and Yu Lan and Chao Shen},
journal= {arXiv preprint arXiv:2402.00263},
year = {2024}
}