LLM生成的虚假信息中的模型归因:基于监督对比学习的领域泛化方法
计算与语言
2024-08-15 v2
摘要
LLM生成的虚假信息模型归因面临着理解其来源并遏制其传播的重大挑战。这一任务尤其具有挑战性,因为因为现代大型语言模型(LLM)产生的虚假信息具有类人质量。此外,生成虚假信息所使用的提示方法的多样性也会使准确的源头归因变得复杂。这些方法会引入特定于领域的特征,这些特征可能掩盖模型的基本特征。在本文中,我们提出将模型归因概念作为领域泛化问题进行处理,其中每个提示方法代表一个独特的领域。我们认为,有效的归因模型必须对这些特定于领域的特征保持不变,并且在所有情景下都应擅长识别来自不同源LLM的特征,反映真实世界检测挑战。为此,我们提出一种基于监督对比学习的新方法。该方法旨在增强模型对提示变化的鲁棒性,专注于区分不同来源LLM。我们通过严格的实验进行了模型评估,其中包括三个常见的提示方法:``open-ended''、``rewriting''和``paraphrasing'',以及三个先进的LLM:``llama 2''、``chatgpt''和``vicuna''。我们的结果表明,我们的方法在模型归因任务中有效,能够在多样化且未被察看的数据集上实现最先进的性能。
引用
@article{arxiv.2407.21264,
title = {Model Attribution in LLM-Generated Disinformation: A Domain Generalization Approach with Supervised Contrastive Learning},
author = {Alimohammad Beigi and Zhen Tan and Nivedh Mudiam and Canyu Chen and Kai Shu and Huan Liu},
journal= {arXiv preprint arXiv:2407.21264},
year = {2024}
}
备注
10 pages, 2 figures, accepted at DSAA 2024