中文

FourierMoE:大型语言模型的傅里叶混合专家适配

机器学习 2026-04-03 v1 人工智能 计算与语言 分布式、并行与集群计算

摘要

参数高效微调(PEFT)已成为在计算资源受限条件下适配大型语言模型(LLM)的关键范式。然而,标准的 PEFT 方法在多任务微调场景中常常表现不佳,因为多样化的优化目标会引发任务干扰,且有限的参数预算会导致表征不足。虽然近期方法引入了混合专家(MoE)来缓解这些问题,但它们主要在空间域中运作,这可能引入结构冗余和参数开销。为克服这些限制,我们在频谱域中重新定义适配。我们的频谱分析揭示,不同任务展现出不同的频率能量分布,且 LLM 层展现出异质的频率敏感性。基于这些洞察,我们提出了 FourierMoE,将 MoE 架构与逆离散傅里叶变换(IDFT)相结合,以实现频率感知的适配。具体而言,FourierMoE 采用频率自适应路由器将令牌分发给专门处理不同频段的专家。每个专家学习一组共轭对称的复数系数,在保持完整相位和幅度信息的同时,理论上保证了无损的 IDFT 重建为实值空间权重。在 28 个基准数据集、多种模型架构和不同规模上的广泛评估表明,FourierMoE 在单任务和多任务设置中均持续优于竞争性基线,同时使用显著更少的可训练参数。这些结果凸显了频谱域专家适配作为 LLM 微调的有效且参数高效范式的潜力。

关键词

引用

@article{arxiv.2604.01762,
  title  = {FourierMoE: Fourier Mixture-of-Experts Adaptation of Large Language Models},
  author = {Juyong Jiang and Fan Wang and Hong Qi and Sunghun Kim and Jing Tang},
  journal= {arXiv preprint arXiv:2604.01762},
  year   = {2026}
}

备注

The first two authors contributed equally to this work; listing order is random