中文

MAD-Fact:基于多智能体辩论的长文本事实性评估框架

计算与语言 2025-10-30 v2 人工智能

摘要

大型语言模型(LLM)的广泛应用引发对其输出事实准确性的严峻质疑,尤其在生物医学、法律和教育等高风险领域。现有短文本评估方法在长文本上常常失效,因其涉及复杂推理链、交织视角与累积信息。为此,我们提出一种系统方法,整合大规模长文本数据集、多智能体验证机制与加权评估指标。构建 LongHalluQA——中文长文本事实性数据集;开发 MAD-Fact——基于多智能体辩论的验证系统。引入事实重要性层级,捕捉文本中声明的差异重要性。实验表明,较大的 LLM 通常保持更高的事实一致性,而国产模型在中文内容方面表现更佳。本工作提供了评估与提升长文本 LLM 输出事实可靠性的结构化框架,指导其在敏感领域的安全部署。

关键词

引用

@article{arxiv.2510.22967,
  title  = {MAD-Fact: A Multi-Agent Debate Framework for Long-Form Factuality Evaluation in LLMs},
  author = {Yucheng Ning and Xixun Lin and Fang Fang and Yanan Cao},
  journal= {arXiv preprint arXiv:2510.22967},
  year   = {2025}
}

备注

The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-51369-x}