FactReasoner:面向大语言模型的长文本事实性评估的概率方法
计算与语言
2025-11-14 v3 人工智能
摘要
大语言模型(LLM)在生成任务中取得了显著成功,但它们在确保输出的事实准确性方面常常不足,从而限制了其在正确性至关重要的真实应用场景中的可靠性。本文提出了FactReasoner,一个基于神经符号框架的事实性评估方法,利用概率推理来评估长文本生成回答的真实性。FactReasoner将回答分解为基本单元,从外部知识源检索相关上下文信息,并使用概率编码建模这些单元与其上下文之间的逻辑关系(如蕴含、矛盾)。随后,它估计每个基本单元获得检索证据支持的后验概率。我们在有标签和无标签的基准数据集上的实验表明,FactReasoner在事实精确率和召回率方面通常优于最先进的基于提示的方法。我们的开源实现公开可用:https://github.com/IBM/FactReasoner。
引用
@article{arxiv.2502.18573,
title = {FactReasoner: A Probabilistic Approach to Long-Form Factuality Assessment for Large Language Models},
author = {Radu Marinescu and Debarun Bhattacharjya and Junkyu Lee and Tigran Tchrakian and Javier Carnerero Cano and Yufang Hou and Elizabeth Daly and Alessandra Pascale},
journal= {arXiv preprint arXiv:2502.18573},
year = {2025}
}