VeriFact:通过精细事实抽取和参考事实提升长篇事实性评估
计算与语言
2025-09-30 v2
摘要
大型语言模型 (LLMs) 在生成长篇回答方面表现出色,但评估其事实性仍具有挑战性,因为生成的事实存在复杂的句间依赖。以往方法主要遵循分解-去语境化-验证管道,常常未能捕获关键上下文并遗漏关键关系事实。在本文中,我们引入 VeriFact,一种旨在增强事实抽取,通过识别和解决不完整和缺失的事实,以支持更准确的验证结果。此外,我们引入 FactRBench,一个评估长篇模型响应中精确率和召回率的基准,而以往工作主要关注精确率。FactRBench 提供来自先进 LLMs 和人类撰写答案的参考事实集合,实现召回率评估。经验评估表明,VeriFact 在增强事实完整性方面显著有效,并保留包含关键关系信息的复杂事实,从而实现更准确的事实性评估。在 FactRBench 上对各种开源和闭源 LLMs 进行基准测试表明,相同模型家族中较大的模型在提升精确率和召回率方面具有优势,但高精确率不一定总是伴随高召回率,凸显了全面事实性评估的重要性。
引用
@article{arxiv.2505.09701,
title = {VeriFact: Enhancing Long-Form Factuality Evaluation with Refined Fact Extraction and Reference Facts},
author = {Xin Liu and Lechen Zhang and Sheza Munir and Yiyang Gu and Lu Wang},
journal= {arXiv preprint arXiv:2505.09701},
year = {2025}
}