用Binoculars识别大语言模型:机器生成文本的零样本检测
计算与语言
2024-10-15 v3 人工智能
机器学习
摘要
检测由现代大型语言模型生成的文本被认为是困难的,因为大语言模型和人类都能表现出广泛复杂的行为。然而,我们发现,基于对比两个紧密相关的语言模型得出的分数,在区分人类生成文本和机器生成文本方面非常准确。基于这一机制,我们提出了一种新颖的大语言模型检测器,它仅需使用一对预训练大语言模型进行简单计算。该方法称为Binoculars,无需任何训练数据即可达到最先进的准确率。它能够识别来自一系列现代大语言模型的机器文本,无需任何模型特定的修改。我们在多种文本来源和不同情境下对Binoculars进行了全面评估。在广泛的文档类型中,Binoculars以0.01%的假阳性率检测出超过90%的ChatGPT(及其他大语言模型)生成样本,尽管它未在任何ChatGPT数据上进行训练。
引用
@article{arxiv.2401.12070,
title = {Spotting LLMs With Binoculars: Zero-Shot Detection of Machine-Generated Text},
author = {Abhimanyu Hans and Avi Schwarzschild and Valeriia Cherepanova and Hamid Kazemi and Aniruddha Saha and Micah Goldblum and Jonas Geiping and Tom Goldstein},
journal= {arXiv preprint arXiv:2401.12070},
year = {2024}
}
备注
20 pages, code available at https://github.com/ahans30/Binoculars