C3PO:用于测试时专家重混合的关键层、核心专家、协作路径优化
机器学习
2025-04-11 v1
摘要
混合专家大型语言模型(MoE LLM)存在专家路径严重次优的问题——我们的研究表明,从预训练中学习到的朴素专家选择留下了 10-20% 的惊人准确率提升空间。受此观察启发,我们开发了一类新颖的测试时优化方法,针对每个测试样本在不同层联合地重新加权或“重混合”专家。由于测试样本的真实标签未知,我们提出优化一个由参考样本集中该样本的“成功邻居”定义的代理目标。我们引入了基于众数寻找、核回归以及相似参考样本/任务平均损失的三种代理和算法。为了降低优化整条路径的成本,我们仅将算法应用于关键层中核心专家的重混合权重,这能保持相似性能但节省大量计算。这便导出了“关键层、核心专家、协作路径优化(C3PO)”。我们将 C3PO 应用于两个最近的 MoE LLM,并在六个广泛使用的基准上进行了检验。它持续地将基础模型的准确率提高了 7-15%,并大幅优于广泛使用的测试时学习基线,例如上下文学习和提示/前缀微调。此外,C3PO 使具有 1-3B 活跃参数的 MoE LLM 优于 7-9B 参数的 LLM,从而提高了 MoE 在效率上的优势。我们详尽的消融研究进一步为在 MoE 上实现测试时提升提供了新见解。
引用
@article{arxiv.2504.07964,
title = {C3PO: Critical-Layer, Core-Expert, Collaborative Pathway Optimization for Test-Time Expert Re-Mixing},
author = {Zhongyang Li and Ziyue Li and Tianyi Zhou},
journal= {arXiv preprint arXiv:2504.07964},
year = {2025}
}