多智能体辩论(MAD)是银弹吗?代码摘要与翻译中MAD的实证分析
软件工程
2025-03-18 v1
摘要
大型语言模型(LLMs)已推进了自主智能体的规划和决策,但它们在需要多样化专业知识和多步推理的复杂任务上仍然存在困难。多智能体辩论(MAD)系统由NLP研究引入,通过使基于LLM的智能体进行结构化辩论来迭代优化解决方案。MAD通过角色特定的智能体、动态交互和结构化决策来促进发散思维。认识到软件工程(SE)与协作式人类问题解决之间的平行关系,本研究调查了MAD在两个SE任务上的有效性。我们从NLP适配了MAD系统,分析智能体交互以评估共识构建和迭代优化,并针对观察到的弱点提出了两种增强方法。我们的发现表明,结构化辩论和协作改善了问题解决,并在某些情况下产生了强劲的性能,突显了MAD在SE自动化中的潜力,同时指出了需要探索的领域。
引用
@article{arxiv.2503.12029,
title = {Is Multi-Agent Debate (MAD) the Silver Bullet? An Empirical Analysis of MAD in Code Summarization and Translation},
author = {Jina Chun and Qihong Chen and Jiawei Li and Iftekhar Ahmed},
journal= {arXiv preprint arXiv:2503.12029},
year = {2025}
}