辩论、反思与精炼:基于树状偏好优化的多智能体反馈以提高语言模型效率
计算与语言
2025-06-05 v1 人工智能
摘要
大型语言模型(LLM)持续在知识密集型和复杂推理任务中设定新的标准,但其高计算需求限制了广泛采用。虽然将大型模型蒸馈到较小模型是一个可持续的解决方案,但当前技术——如静态知识蒸馈、资源密集型强化学习从人类反馈,或是有限的自我反思——难以获得显著且持久的性能提升。在本文中,我们提出一种新的辩论与反思(Debate and Reflect, D&R)框架,通过组织较小模型与更强教师模型之间的多轮辩论,挖掘可操作的反馈(例如错误分析、纠正策略)以指导学生模型。进一步,我们引入树状直接偏好优化(T-DPO)来高效地利用这些辩论日志,将交互组织成层次格式以实现有效训练。跨多个 diverse NLP 基准的实证评估表明,我们的方法显著提高了较小模型的准确率、鲁棒性和泛化能力,显著优于传统基线方法。
引用
@article{arxiv.2506.03541,
title = {Debate, Reflect, and Distill: Multi-Agent Feedback with Tree-Structured Preference Optimization for Efficient Language Model Enhancement},
author = {Xiaofeng Zhou and Heyan Huang and Lizi Liao},
journal= {arXiv preprint arXiv:2506.03541},
year = {2025}
}
备注
16 pages, 10 figures. The camera-ready paper for Findings of ACL 2025