基于混合空间专家的 LLM 参数高效微调
机器学习
2026-02-17 v1 人工智能
计算与语言
神经与进化计算
摘要
大型语言模型(LLM)取得了显著进展,参数高效微调(PEFT)成为下游任务适应的关键技术。然而,现有 PEFT 方法主要在欧几里得空间中运作,根本限制了其捕捉语言数据固有复杂几何结构的能力。虽然 hyperbolic geometries 可用于层次数据、spherical manifolds 可用于圆形模式,但强行表示嵌入单一流形类型最终限制了表达力度,即使曲率参数可学习。为此,我们提出了混合空间(Mixture of Space, MoS)框架,利用多种几何空间同时学习更丰富、曲率感知的表征。基于此方案,我们开发了 MoSLoRA,将低秩适应(LoRA)扩展为具有异构几何专家的结构,使模型能够根据输入上下文动态选择或组合合适的几何空间。此外,为解决频繁流形切换带来的计算开销,我们开发了轻量级路由机制。我们还提供了关于曲率优化如何影响训练稳定性和模型性能的经验见解。跨越多个基准的实验表明,MoSLoRA 在强大基线上 consistently 取得优异成绩,在 MATH500 上提升最高可达 5.6%,在 MAWPS 上提升最高可达 15.9%。
引用
@article{arxiv.2602.14490,
title = {Parameter-Efficient Fine-Tuning of LLMs with Mixture of Space Experts},
author = {Buze Zhang and Jinkai Tao and Zilang Zeng and Neil He and Ali Maatouk and Menglin Yang and Rex Ying},
journal= {arXiv preprint arXiv:2602.14490},
year = {2026}
}
备注
15 pages, 11 figures