WikiContradict:评估大语言模型处理维基百科真实世界知识冲突的基准
计算与语言
2024-06-21 v1 人工智能
机器学习
摘要
检索增强生成(RAG)已成为缓解大语言模型(LLMs)局限性(如幻觉和过时信息)的一种有前景的解决方案。然而,LLMs如何处理来自不同增强检索段落的知识冲突仍不清楚,特别是当这些段落源自同一来源且具有同等可信度时。在这项工作中,我们对LLMs针对基于维基百科(一个被广泛认为是大多数LLMs高质量预训练资源的数据集)中矛盾段落而具有不同答案的问题所生成的回答进行了全面评估。具体来说,我们引入了WikiContradict,一个包含253个高质量、人工标注实例的基准,旨在评估LLMs在增强检索段落包含真实世界知识冲突时的性能。我们对多种闭源和开源LLMs在不同问答场景下进行了基准测试,包括单段落RAG和双矛盾段落RAG。通过对涉及5个LLMs和超过3500个判断的WikiContradict子集进行严格的人工评估,我们揭示了这些模型的行为和局限性。例如,当提供两个包含矛盾事实的段落时,所有模型都难以生成准确反映上下文矛盾性质的答案,尤其是对于需要推理的隐式冲突。由于人工评估成本高昂,我们还引入了一个自动化模型,该模型使用强大的开源语言模型来估计LLM性能,达到了0.8的F值。利用这一自动化指标,我们评估了来自7个LLMs在全部WikiContradict实例上的超过1500个答案。为促进未来研究,我们在 https://ibm.biz/wikicontradict 上发布了WikiContradict。
引用
@article{arxiv.2406.13805,
title = {WikiContradict: A Benchmark for Evaluating LLMs on Real-World Knowledge Conflicts from Wikipedia},
author = {Yufang Hou and Alessandra Pascale and Javier Carnerero-Cano and Tigran Tchrakian and Radu Marinescu and Elizabeth Daly and Inkit Padhi and Prasanna Sattigeri},
journal= {arXiv preprint arXiv:2406.13805},
year = {2024}
}