Faithful, Unfaithful or Ambiguous? Multi-Agent Debate with Initial Stance for Summary Evaluation
计算与语言
2025-02-14 v2
摘要
基于大型语言模型(LLMs)的忠实度评估器常常被文本的流畅性所欺骗,难以识别摘要中的错误。我们提出了一种摘要忠实度评估方法,其中多个基于LLM的智能体被赋予初始立场(无论其真实信念如何),并被迫提出理由来证明所赋予的信念,从而参与多轮辩论以达成一致。均匀分布的初始分配导致了立场更大的多样性,从而引发更有意义的辩论,并最终识别出更多的错误。此外,通过分析最近的忠实度评估数据集,我们观察到,摘要并非总是对源文档完全忠实或不忠实。因此,我们引入了一个新的维度——模糊性,以及一个详细的分类法来识别这类特殊情况。实验表明,我们的方法有助于识别模糊性,并且在非模糊性摘要上表现出更强的性能。
引用
@article{arxiv.2502.08514,
title = {Faithful, Unfaithful or Ambiguous? Multi-Agent Debate with Initial Stance for Summary Evaluation},
author = {Mahnaz Koupaee and Jake W. Vincent and Saab Mansour and Igor Shalyminov and Han He and Hwanjun Song and Raphael Shu and Jianfeng He and Yi Nian and Amy Wing-mei Wong and Kyu J. Han and Hang Su},
journal= {arXiv preprint arXiv:2502.08514},
year = {2025}
}