从文本到源头:大语言模型生成内容检测的结果
计算与语言
2024-03-28 v2
摘要
大语言模型(LLMs)因生成类人文本的能力而广受赞誉,其广泛使用引发了关于错误信息与伦理影响的担忧。应对这些担忧需要开发稳健方法来检测并归因LLM生成的文本。本文研究“跨模型检测”,即评估一个经训练以区分源LLM生成文本与人工撰写文本的分类器,是否能在无进一步训练的情况下检测来自目标LLM的文本。该研究全面探索了各类LLM规模与系列,并评估了对话微调技术、量化和水印对分类器泛化的影响。除量化与水印检测外,该研究还探索了模型归因,涵盖源模型识别、模型系列与模型规模分类。我们的结果揭示了若干关键发现:分类器效能与模型规模间存在明显的反比关系,较大LLM更难以检测,尤其当分类器在较小模型数据上训练时。在相似规模LLM数据上训练可提升对较大模型的检测性能,但在处理较小模型时可能导致性能下降。此外,模型归因实验在识别源模型与模型系列方面显示出有前景的结果,凸显了LLM生成文本中可检测的签名,其中水印检测效果尤为显著,而未观察到可检测的量化签名。总体而言,我们的研究为LLM检测与归因中模型规模、系列及训练数据的相互作用提供了宝贵见解。
引用
@article{arxiv.2309.13322,
title = {From Text to Source: Results in Detecting Large Language Model-Generated Content},
author = {Wissam Antoun and Benoît Sagot and Djamé Seddah},
journal= {arXiv preprint arXiv:2309.13322},
year = {2024}
}
备注
Accepted to COLING-LREC 2024