中文

GLUE:无梯度学习统一专家

机器学习 2026-01-30 v2

摘要

在许多部署系统(多语言语音识别、跨医院影像、区域特定感知)中,多个预训练专家模型共存。然而,新目标域往往需要域扩展:一个在任何单个专家域之外都能表现良好的通用模型。给定新目标域,现有方法通过混合专家模型来获得模型参数的单一强初始化。然而,基于数据大小或代理指标的启发式混合策略往往导致目标域测试精度较低,通过目标域损失函数学习这些系数通常需要对神经网络进行计算昂贵的完整反向传播。我们提出 GLUE,无梯度学习统一专家,通过 SPSA(simultaneous perturbation stochastic approximation)无梯度更新来学习该组合的混合系数,仅需每步两个前向传播。跨三个数据集和三个网络架构的实验表明,GLUE 生成的模型参数先验可以在微调后超越基线。GLUE 在数据大小加权和代理指标选择上分别将测试精度提升最高可达 8.5% 和 9.1%。GLUE 要么显著优于基于反向传播的全梯度混合方法,要么在 1.4% 内匹配其性能。

关键词

引用

@article{arxiv.2512.22467,
  title  = {GLUE: Gradient-free Learning to Unify Experts},
  author = {Jong-Ik Park and Shreyas Chaudhari and Srinivasa Pranav and Carlee Joe-Wong and José M. F. Moura},
  journal= {arXiv preprint arXiv:2512.22467},
  year   = {2026}
}

备注

To be published at IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026