信任还是不信任?增强大语言模型对外部上下文的情境忠实性
计算与语言
2025-03-18 v2 人工智能
摘要
大语言模型(LLM)通常通过外部上下文进行增强,例如检索增强生成(RAG)中使用的那些。然而,这些上下文可能不准确或故意误导,导致与模型的内部知识发生冲突。我们认为,稳健的LLM应表现出情境忠实性,即根据其对内部知识和外部上下文的置信度动态校准对外部信息的信任,以解决知识冲突。为了基准测试这一能力,我们在几个问答数据集上评估了LLM,包括一个新创建的数据集,其中包含来自Reddit帖子的真实世界错误上下文。我们表明,当同时提供正确和错误的上下文时,开源和专有模型都倾向于过度依赖外部信息,无论其事实准确性如何。为了增强情境忠实性,我们提出了两种方法:自引导置信度推理(SCR)和基于规则的置信度推理(RCR)。SCR使模型能够自我评估外部信息相对于其自身内部知识的置信度,以产生最准确的答案。相比之下,RCR从LLM中提取显式的置信度信号,并使用预定义规则确定最终答案。我们的结果表明,对于具有强大推理能力的LLM,如GPT-4o和GPT-4o mini,SCR优于RCR,与直接输入增强基线相比,性能提升高达24.2%。相反,对于像Llama-3-8B这样较小的模型,RCR优于SCR。使用我们提出的置信度推理直接偏好优化(CR-DPO)方法微调SCR,在已见和未见数据集上都提高了性能,在Llama-3-8B上平均提升了8.9%。除了定量结果,我们还提供了关于SCR和RCR相对优势的见解。
引用
@article{arxiv.2410.14675,
title = {To Trust or Not to Trust? Enhancing Large Language Models' Situated Faithfulness to External Contexts},
author = {Yukun Huang and Sanxing Chen and Hongyi Cai and Bhuwan Dhingra},
journal= {arXiv preprint arXiv:2410.14675},
year = {2025}
}