中文

更小的语言模型是更优的黑盒机器生成文本检测器

计算与语言 2024-02-27 v4 机器学习

摘要

随着流畅的生成式语言模型的出现,它们能够生成与人类书写极为相似的令人信服的文本,区分一段文本是机器生成还是人类书写变得更加困难也更加重要,因为此类模型可能被用于传播错误信息、假新闻、虚假评论以及模仿特定作者和人物。为此,已有大量方法被提出以检测机器生成文本。其中大多数方法需要访问目标模型的 logits 或需要从目标模型采样。一种这样的黑盒检测方法依赖于如下观察:生成文本在生成器的似然函数下是局部最优的,而人类书写文本则不是。我们发现,总体而言,更小且部分训练的模型是更优的通用文本检测器:它们能够更精确地检测来自小型和更大型模型的生成文本。有趣的是,我们发现检测器与生成器是否在相同数据上训练对检测成功并非至关重要。例如,OPT-125M 模型在检测 ChatGPT 生成文本时的 AUC 为 0.81,而来自 GPT 家族的更大模型 GPTJ-6B 的 AUC 为 0.45。

关键词

引用

@article{arxiv.2305.09859,
  title  = {Smaller Language Models are Better Black-box Machine-Generated Text Detectors},
  author = {Niloofar Mireshghallah and Justus Mattern and Sicun Gao and Reza Shokri and Taylor Berg-Kirkpatrick},
  journal= {arXiv preprint arXiv:2305.09859},
  year   = {2024}
}