基于贝叶斯代理模型的高效LLM生成文本检测
机器学习
2024-06-05 v3 人工智能
计算与语言
摘要
机器生成文本的检测,尤其是来自大语言模型(LLMs)的文本,对于防范其滥用所导致的严重社会问题至关重要。一些方法在特定数据集上训练专用检测器,但难以泛化到未见的测试数据,而其他零样本方法往往性能次优。尽管近期的DetectGPT展现出有前景的检测性能,但其存在显著的效率低下问题,因为检测单个候选文本需要以数百个扰动查询源LLM。本文旨在弥补这一差距。具体地,我们提出引入贝叶斯代理模型,该模型使我们能够基于贝叶斯不确定性筛选典型样本,并将典型样本的分数插值到其他样本,从而提高查询效率。实证结果表明,在低查询预算下我们的方法显著优于现有方法。值得注意的是,在检测LLaMA系列模型生成的文本时,我们仅用2或3次查询的方法便可超越使用200次查询的DetectGPT。
引用
@article{arxiv.2305.16617,
title = {Efficient Detection of LLM-generated Texts with a Bayesian Surrogate Model},
author = {Yibo Miao and Hongcheng Gao and Hao Zhang and Zhijie Deng},
journal= {arXiv preprint arXiv:2305.16617},
year = {2024}
}