中文

ConflictBank:用于评估大语言模型知识冲突影响的基准

计算与语言 2024-08-23 v1 人工智能

摘要

大型语言模型(LLMs)在诸多领域取得了显著的进展,但知识冲突——这是导致幻觉的主要来源之一——却鲜有被研究。只有少数研究探讨了 LLMs 内在知识与检索上下文知识之间的冲突。然而,对知识冲突的全面评估仍然缺失。为了弥补这一研究空白,我们提出了 ConflictBank,这是第一个系统评估知识冲突的全面基准,涵盖三个方面:(i) 检索知识中遇到的冲突,(ii) 模型编码知识中的冲突,以及 (iii) 这些冲突形式之间的相互作用。我们的研究深入分析了四个模型家族和十二个 LLM 实例,仔细考察了源于误information、时间差异和语义差异的冲突。基于我们提出的新型构建框架,我们创建了 7,453,853 对 claim-evidence 配对和 553,117 对 QA 配对。我们提出了关于模型规模、冲突原因和冲突类型的诸多发现。我们希望我们的 ConflictBank 基准能够帮助社区更好地理解模型在冲突情境下的行为,并开发出更可靠的 LLMs。

关键词

引用

@article{arxiv.2408.12076,
  title  = {ConflictBank: A Benchmark for Evaluating the Influence of Knowledge Conflicts in LLM},
  author = {Zhaochen Su and Jun Zhang and Xiaoye Qu and Tong Zhu and Yanshu Li and Jiashuo Sun and Juntao Li and Min Zhang and Yu Cheng},
  journal= {arXiv preprint arXiv:2408.12076},
  year   = {2024}
}

备注

Under Review