中文

人类需要疫苗,模型亦然:模型免疫以对抗虚假信息

计算与语言 2026-04-02 v4

摘要

大语言模型(LLMs)并非仅通过记忆虚假事实来传播虚假信息,而是通过学习使虚假信息具有说服力的语言模式,例如模糊措辞、虚假预设和捏造引用。我们提出了模型免疫,一种基于监督微调的训练范式,在经过筛选的(虚假声明、纠正)配对上进行训练,以小剂量疫苗(5%至10%的token)的形式与真实数据一同注入。与事后过滤或基于偏好的对齐不同,免疫方法对标记的虚假信息引入了直接的负监督。在四个开放权重模型族中,该方法将TruthfulQA准确率提升了12个百分点,并将虚假信息拒绝率提升了30个百分点,同时保持了整体模型能力。我们进一步概述了关键设计要求,包括剂量、标注、隔离和多样性,并倡导标准化的疫苗语料库和基准来评估泛化能力。这些发现将免疫定位为负责任LLM开发中实用且可扩展的组成部分。

引用

@article{arxiv.2505.17870,
  title  = {Just as Humans Need Vaccines, So Do Models: Model Immunization to Combat Falsehoods},
  author = {Shaina Raza and Rizwan Qureshi and Azib Farooq and Marcelo Lotif and Aman Chadha and Deval Pandya and Christos Emmanouilidis},
  journal= {arXiv preprint arXiv:2505.17870},
  year   = {2026}
}