使用风格表征的小样本机器生成文本检测
计算与语言
2024-05-09 v3 机器学习
摘要
经过指令微调的语言模型能够令人信服地模仿人类写作,这带来了重大的滥用风险。然而,可以通过检测一段文本是由语言模型还是人类作者撰写的能力来对抗这种滥用。先前解决此问题的一些方法依赖于监督方法,通过在已确认的人类和机器撰写的文档语料库上进行训练。不幸的是,模型欠规范化对基于神经网络的检测器构成了不可避免的挑战,使其在面对数据偏移(例如,发布比训练检测器所用模型生成更流畅文本的更新语言模型)时变得脆弱。其他方法需要访问可能生成了相关文档的模型,这通常不切实际。鉴于这些挑战,我们追求一种根本不同的方法,在训练时不依赖来自相关语言模型的样本。相反,我们提议利用从人类撰写文本中估计的写作风格表征。事实上,我们发现有效区分人类作者的特征也能有效区分人类和机器作者,包括最先进的大型语言模型,如 Llama-2、ChatGPT 和 GPT-4。此外,给定由几个特定感兴趣的语言模型各自撰写的少量示例,我们的方法能够预测哪个模型生成了给定的文档。复现我们实验的代码和数据可在 https://github.com/LLNL/LUAR/tree/main/fewshot_iclr2024 获取。
引用
@article{arxiv.2401.06712,
title = {Few-Shot Detection of Machine-Generated Text using Style Representations},
author = {Rafael Rivera Soto and Kailin Koch and Aleem Khan and Barry Chen and Marcus Bishop and Nicholas Andrews},
journal= {arXiv preprint arXiv:2401.06712},
year = {2024}
}