大语言模型时代下的开放域问答评估
计算与语言
2023-07-10 v3
摘要
词法匹配仍是开放域问答(QA)的事实评估方法。遗憾的是,当合理候选答案未出现在标准答案列表中时,词法匹配完全失效,而随着我们从抽取式模型转向生成式模型,这种情况愈发普遍。大语言模型(LLM)在 QA 上的近期成功加剧了词法匹配失败,因为候选答案变长,从而与标准答案的匹配更具挑战。缺乏准确评估,开放域 QA 的真实进展仍属未知。本文中,我们通过在热门基准 NQ-open 的子集上人工评估包括 LLM 在内的多种开放域 QA 模型的答案,进行了透彻分析。我们的评估揭示:所有模型的真实性能均被显著低估,其中 InstructGPT(零样本) LLM 的性能提升近 +60%,使其与现有顶级模型持平,而 InstructGPT(少样本)模型实际在 NQ-open 上达到了新的 state-of-the-art。我们还发现超过 50% 的词法匹配失败归因于语义等价答案。我们进一步证明正则匹配对 QA 模型的排序与人类判断一致,尽管仍受不必要的严格性困扰。最后,我们证明自动化评估模型在某些情况下是词法匹配的合理解替身,但不适用于 LLM 生成的长形式答案。自动化模型难以检测 LLM 答案中的幻觉,因而无法评估 LLM。目前,似乎无可替代人工评估。
引用
@article{arxiv.2305.06984,
title = {Evaluating Open-Domain Question Answering in the Era of Large Language Models},
author = {Ehsan Kamalloo and Nouha Dziri and Charles L. A. Clarke and Davood Rafiei},
journal= {arXiv preprint arXiv:2305.06984},
year = {2023}
}
备注
ACL 2023; code and data released at https://github.com/ehsk/OpenQA-eval