中文

错误信息如何影响大型语言模型的行为与偏好?

计算与语言 2025-05-29 v1 人工智能

摘要

大型语言模型(LLM)在知识密集型任务中展现出了卓越的能力,但在遭遇错误信息时仍然容易受到影响。现有研究探讨了 LLM 在对抗错误信息中的作用,但仍缺乏关于 LLM 受错误信息影响的具体方面和程度的细粒度分析。为了填补这一空白,我们提出了 MisBench,这是目前用于评估 LLM 对错误信息的行为和知识偏好的最大、最全面的基准。MisBench 包含 10,346,712 条错误信息,独特地兼顾了错误信息中基于知识的冲突和风格变化。实证结果表明,尽管 LLM 在辨别错误信息方面表现出相当的能力,但它们仍然容易受到知识冲突和风格变化的影响。基于这些发现,我们进一步提出了一种名为“重构以判别”(RtD)的新方法,以增强 LLM 检测错误信息的能力。我们的研究为 LLM 与错误信息的交互提供了有价值的见解,我们相信 MisBench 可以作为一个有效的基准,用于评估基于 LLM 的检测器并提升其在实际应用中的可靠性。代码和数据可在 https://github.com/GKNL/MisBench 获取。

关键词

引用

@article{arxiv.2505.21608,
  title  = {How does Misinformation Affect Large Language Model Behaviors and Preferences?},
  author = {Miao Peng and Nuo Chen and Jianheng Tang and Jia Li},
  journal= {arXiv preprint arXiv:2505.21608},
  year   = {2025}
}

备注

Accepted to ACL 2025 Main Conference