UAQFact:评估大语言模型在不可回答问题上的事实知识利用能力
计算与语言
2025-05-30 v1
摘要
处理不可回答问题(UAQ)对大语言模型(LLM)至关重要,因为它有助于防止在复杂情境下产生误导性回答。尽管先前的研究构建了多个数据集来评估 LLM 在 UAQ 上的表现,但这些数据集缺乏事实知识支持,从而限制了对 LLM 在处理 UAQ 时利用其事实知识能力的评估。为解决这一局限性,我们引入了一个新的不可回答问题数据集 UAQFact,这是一个基于知识图谱构建的带有辅助事实知识的双语数据集。基于 UAQFact,我们进一步定义了两个新任务,以分别衡量 LLM 利用内部和外部事实知识的能力。我们在多个 LLM 系列上的实验结果表明,UAQFact 带来了显著挑战,因为即使 LLM 存储了事实知识,其表现也并不总是稳定良好。此外,我们发现引入外部知识可能会提升性能,但 LLM 仍无法充分利用这些知识,这可能导致错误的回答。
引用
@article{arxiv.2505.23461,
title = {UAQFact: Evaluating Factual Knowledge Utilization of LLMs on Unanswerable Questions},
author = {Chuanyuan Tan and Wenbiao Shao and Hao Xiong and Tong Zhu and Zhenhua Liu and Kai Shi and Wenliang Chen},
journal= {arXiv preprint arXiv:2505.23461},
year = {2025}
}
备注
ACL 2025 Findings