MAGDi:多智能体交互图的结构化蒸馏提升小型语言模型的推理能力
计算与语言
2024-06-11 v2
摘要
大语言模型 (LLM) 智能体之间的多智能体交互已在多种推理任务中显示出重大改进。然而,这些方法涉及多个模型在多轮次中的长序列生成,导致成本高昂。此外,这些多智能体方法无法提供用于高效推理的最终单一模型。为解决这一问题,我们引入了 MAGDi,这是一种将多个 LLM 之间的推理交互结构化蒸馏到小型 LM 中的新方法。MAGDi 通过将多智能体交互表示为图、用图编码器增强基础学生模型,并利用三个目标函数进行知识蒸馏来教导小型模型:下一个 token 预测、正确与错误推理之间的对比损失,以及建模交互结构的基于图的目标函数。在七个广泛使用的常识和数学推理基准上的实验表明,MAGDi 提升了小型模型的推理能力,优于多种从单一教师和多教师蒸馏的方法。此外,MAGDi 还展现出比其教师模型高出一个数量级的效率。我们进行了广泛分析,表明 MAGDi:(1) 增强了对域外任务的泛化能力;(2) 随基础学生模型的规模和强度正向扩展;(3) 在应用自一致性(一种依赖模型多样性的推理技术)时,通过我们的多教师训练获得了更大的改进。
引用
@article{arxiv.2402.01620,
title = {MAGDi: Structured Distillation of Multi-Agent Interaction Graphs Improves Reasoning in Smaller Language Models},
author = {Justin Chih-Yao Chen and Swarnadeep Saha and Elias Stengel-Eskin and Mohit Bansal},
journal= {arXiv preprint arXiv:2402.01620},
year = {2024}
}
备注
ICML 2024 (Camera-ready); First two authors contributed equally; GitHub: https://github.com/dinobby/MAGDi