MAMM-Refine:用于改进生成任务中忠实性的多智能体协作配方
计算与语言
2025-03-20 v1 人工智能
摘要
多智能体协作在推理任务中已展现出潜力,但在类似摘要和问答等长文本生成任务中仍受到忽视。我们将多智能体多模型推理扩展到生成任务中,具体目标是通过精炼(即修订模型生成的输出以消除事实性不一致)来提高忠实性。我们研究了多个大语言模型 (LLM) 实例和类型的迭代协作如何增强精炼过程中的各个子任务,如错误检测、批判性分析不忠实句子以及根据批判进行修正。我们为每个子任务设计了内在评估指标,研究结果表明,无论是多智能体(多个实例)还是多模型(多样化 LLM 类型)的方法,都有助于提高错误检测和批判性分析的效果。此外,将批判和精炼重新定义为排序任务而非生成任务,可显著提升多智能体性能。我们将这些发现归纳为最终的配方——多智能体多模型精炼 (MAMM-Refine),其中多智能体和多模型协作在三个摘要数据集以及长文本问答任务上显著提升性能,证明了该配方的有效性和可推广性。
引用
@article{arxiv.2503.15272,
title = {MAMM-Refine: A Recipe for Improving Faithfulness in Generation with Multi-Agent Collaboration},
author = {David Wan and Justin Chih-Yao Chen and Elias Stengel-Eskin and Mohit Bansal},
journal= {arXiv preprint arXiv:2503.15272},
year = {2025}
}
备注
NAACL 2025, 18 pages. Code: https://github.com/meetdavidwan/mammrefine