EAGLE:面向AI生成文本检测的域泛化框架
计算与语言
2024-03-26 v1 人工智能
机器学习
摘要
随着大语言模型(LLM)能力的提升,负责任且安全地使用此类LLM的关键一步是能够检测这些模型生成的文本。虽然监督式AI生成文本检测器在检测较旧LLM生成的文本时表现良好,但随着新LLM的频繁发布,构建用于识别这些新模型生成文本的监督检测器需要新的标注训练数据,这在实践中不可行。在这项工作中,我们解决了这一问题,并提出了一种用于检测来自未见目标生成器的AI生成文本的域泛化框架。我们提出的框架EAGLE利用迄今为止从较旧语言模型获得的标注数据,学习这些生成器之间不变的特征,以检测未知目标生成器生成的文本。EAGLE通过将自监督对比学习的表征能力与域对抗训练相结合来学习这种域不变特征。通过实验,我们展示了EAGLE如何有效地在检测未见目标生成器(包括最新的GPT-4和Claude等)生成的文本方面取得令人印象深刻的性能,检测分数达到完全监督检测器的4.7%以内。
引用
@article{arxiv.2403.15690,
title = {EAGLE: A Domain Generalization Framework for AI-generated Text Detection},
author = {Amrita Bhattacharjee and Raha Moraffah and Joshua Garland and Huan Liu},
journal= {arXiv preprint arXiv:2403.15690},
year = {2024}
}