MAD-Fact:基于多智能体辩论的长文本事实性评估框架
计算与语言
2025-10-30 v2 人工智能
摘要
大型语言模型(LLM)的广泛应用引发对其输出事实准确性的严峻质疑,尤其在生物医学、法律和教育等高风险领域。现有短文本评估方法在长文本上常常失效,因其涉及复杂推理链、交织视角与累积信息。为此,我们提出一种系统方法,整合大规模长文本数据集、多智能体验证机制与加权评估指标。构建 LongHalluQA——中文长文本事实性数据集;开发 MAD-Fact——基于多智能体辩论的验证系统。引入事实重要性层级,捕捉文本中声明的差异重要性。实验表明,较大的 LLM 通常保持更高的事实一致性,而国产模型在中文内容方面表现更佳。本工作提供了评估与提升长文本 LLM 输出事实可靠性的结构化框架,指导其在敏感领域的安全部署。
引用
@article{arxiv.2510.22967,
title = {MAD-Fact: A Multi-Agent Debate Framework for Long-Form Factuality Evaluation in LLMs},
author = {Yucheng Ning and Xixun Lin and Fang Fang and Yanan Cao},
journal= {arXiv preprint arXiv:2510.22967},
year = {2025}
}
备注
The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-51369-x}