Cofca:一种逐步反事实多跳问答基准
计算与语言
2024-10-16 v5
摘要
虽然大型语言模型(LLMs)在问答(QA)任务中表现出色,但它们在多跳 QA 任务中进行多证据检索与整合的真实推理能力仍未得到充分探索。首先,LLMs 有时会生成依赖内部记忆而非在给定上下文中检索证据和推理的答案,这引发了对其真实推理能力评估质量的担忧。尽管先前的反事实 QA 基准可以分离 LLMs 的内部记忆,但它们仅关注最终的 QA 性能,不足以报告 LLMs 的真实推理能力,因为 LLMs 被期望参与涉及从给定段落中检索证据并回答一系列子问题的复杂推理过程。此外,当前的事实性多跳 QA(MHQA)基准是在维基百科等开源语料库上标注的,虽然有助于多步推理评估,但由于 LLMs 预训练阶段可能存在的数据污染问题,其显示出局限性。为解决这些问题,我们引入了逐步反事实基准(CofCA),这是一个由事实数据和反事实数据组成的新颖评估基准,旨在揭示 LLMs 在多步推理和推理链评估方面的真实推理能力。我们的实验结果显示,多个 LLMs 在基于维基百科的事实数据与反事实数据之间存在显著的性能差距,证实了现有基准中存在数据污染问题。此外,我们观察到 LLMs 通常会绕过正确的推理链,表现出虚高的多步推理性能。我们相信,CofCA 基准将增强并促进对可信 LLMs 的评估。
引用
@article{arxiv.2402.11924,
title = {Cofca: A Step-Wise Counterfactual Multi-hop QA benchmark},
author = {Jian Wu and Linyi Yang and Zhen Wang and Manabu Okumura and Yue Zhang},
journal= {arXiv preprint arXiv:2402.11924},
year = {2024}
}