中文

AuthentiGPT:通过黑盒语言模型去噪检测机器生成文本

计算与语言 2023-11-15 v1 人工智能 机器学习

摘要

大语言模型(LLMs)在带来巨大机遇的同时也引发了伦理困境。其主要担忧之一在于它们能够生成高度模仿人类写作的文本,这可能导致学术不端、虚假信息和欺诈等潜在滥用。为解决此问题,我们提出 AuthentiGPT,一种区分机器生成文本与人类撰写文本的高效分类器。基于人类撰写文本位于机器生成文本分布之外的假设,AuthentiGPT 利用黑盒 LLM 对人为添加噪声的输入文本进行去噪,随后将去噪文本与原文在语义上比较,以判定内容是否为机器生成。AuthentiGPT 仅有一个可训练参数,无需大型训练数据集、无需对 LLM 输出加水印,也无需计算对数似然。重要的是,AuthentiGPT 的检测能力可轻松适配任意生成式语言模型。在领域特定数据集上取得 0.918 的 AUROC 分数,AuthentiGPT 相对于其他商业算法展现了有效性,凸显了其在学术场景中检测机器生成文本的潜力。

关键词

引用

@article{arxiv.2311.07700,
  title  = {AuthentiGPT: Detecting Machine-Generated Text via Black-Box Language Models Denoising},
  author = {Zhen Guo and Shangdi Yu},
  journal= {arXiv preprint arXiv:2311.07700},
  year   = {2023}
}