中文

被生成上下文蒙蔽:语言模型在知识冲突中如何合并生成和检索的上下文

计算与语言 2024-06-13 v6 人工智能

摘要

虽然辅助信息已成为增强大型语言模型(LLMs)的关键,但关于LLMs如何合并这些上下文——特别是LLMs生成的上下文和从外部来源检索的上下文——却知之甚少。为了研究这一点,我们构建了一个系统框架来识别LLMs的响应是归因于生成的上下文还是检索的上下文。为了便于追溯响应的来源,我们构建了具有冲突上下文的数据集,即每个问题都配有一个生成的上下文和一个检索的上下文,但只有其中一个包含正确答案。我们的实验揭示了几个LLMs(GPT-4/3.5和Llama2)存在显著偏向于生成上下文的偏见,即使它们提供错误信息。我们进一步确定了导致这种偏见的两个关键因素:i) LLMs生成的上下文通常与问题具有更大的相似性,增加了它们被选中的可能性;ii) 检索上下文中使用的分段过程破坏了其完整性,从而阻碍了它们在LLMs中的充分利用。我们的分析增强了对LLMs如何合并不同上下文的理解,为推进当前的LLM增强方法提供了有价值的见解,并突显了生成错误信息对检索增强型LLMs的风险。

关键词

引用

@article{arxiv.2401.11911,
  title  = {Blinded by Generated Contexts: How Language Models Merge Generated and Retrieved Contexts When Knowledge Conflicts?},
  author = {Hexiang Tan and Fei Sun and Wanli Yang and Yuanzhuo Wang and Qi Cao and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2401.11911},
  year   = {2024}
}

备注

Accepted at ACL 2024 Main, Homepage (https://tan-hexiang.github.io/Blinded_by_Generated_Contexts/)