PT-MoE:将混合专家集成到提示调优中的高效微调框架
计算与语言
2025-05-15 v1
摘要
参数高效微调(PEFT)方法在适配大型语言模型方面显示出前景。然而,现有方法表现出反直觉现象:将路由器集成到提示调优(PT)中会提高训练效率,却不普遍提升性能;通过矩阵分解实现参数减少可在特定领域提升性能。受这些观察以及PT的模块化特性启发,我们提出PT-MoE,一种将矩阵分解与混合专家(MoE)路由集成以实现高效PT的新框架。结果表明,PT-MoE在17个数据集上实现了在问答(QA)和数学问题解决任务中的领先性能,相较于PT提高1.49分F1分数,相较于LoRA提高2.13分F1分数,在QA任务中;在数学准确率方面,相较于PT提高10.75分,相较于LoRA提高0.44分,同时使用比LoRA少25%的参数。我们的分析揭示,PT方法通常在QA任务中表现突出,而LoRA方法在数学数据集中表现更好,矩阵分解与MoE在PT-MoE中集成产生互补性收益:分解使得专家之间高效的参数共享成为可能,而MoE提供动态适应,共同使PT-MoE能够展示跨任务的一致性和泛化能力。这些发现以及对路由机制和构件的消融研究,为未来的PEFT方法提供了见解。
引用
@article{arxiv.2505.09519,
title = {PT-MoE: An Efficient Finetuning Framework for Integrating Mixture-of-Experts into Prompt Tuning},
author = {Zongqian Li and Yixuan Su and Nigel Collier},
journal= {arXiv preprint arXiv:2505.09519},
year = {2025}
}