单-多演化循环:自我改进模型协作系统
计算与语言
2026-02-25 v2
摘要
模型协作——即多个语言模型 (LM) 协作的系统——将结合不同模型的优势,同时带来加载多个模型的成本。我们通过将协作模式蒸馏到单个模型中来提高效率,同时保持协作的优势:该模型在模型协作系统的输出上进行训练。推理时,仅使用蒸馏后的模型:它模仿协作,却仅以单个模型的成本运行。进一步,我们提出单-多演化循环:多个 LM 协作,每个模型从协作输出中蒸馏,然后这些经蒸馏后改进的模型再次协作,形成一个集体演化生态系统,其中模型通过与其他模型的互动来演化和自我改进。针对 7 种协作策略和 15 个任务 (QA、推理、事实性等) 进行大量实验,证明:1) 单个模型平均提升 8.0%,吸收了协作的优势,同时将成本降低到单个模型;2) 协作也受益于蒸馏后的更强大且更具协同力的 LM,平均提升 14.9% 超过初始系统。分析表明,单-多演化循环优于各种现有演化 AI 方法,兼容多样化的模型/协作/蒸馏设置,并帮助解决初始模型/系统难以解决的问题。
引用
@article{arxiv.2602.05182,
title = {The Single-Multi Evolution Loop for Self-Improving Model Collaboration Systems},
author = {Shangbin Feng and Kishan Panaganti and Yulia Tsvetkov and Wenhao Yu},
journal= {arXiv preprint arXiv:2602.05182},
year = {2026}
}
备注
Code at https://github.com/BunsenFeng/moco_distill