MEPT:作为流形映射器的专家混合提示微调
机器学习
2025-09-16 v2 人工智能
计算与语言
摘要
将深度神经网络视为流形映射器,预训练-后微调范式可以被解释为一个两阶段过程:预训练建立一个广泛的知识库,而微调则调整模型参数以激活特定的神经通路,从而与目标流形对齐。尽管先前的微调方法取得了成功,但其刚性的参数空间限制了它们动态激活适当神经通路的能力,使其难以灵活适应多样且不断演变的数据分布。基于这一观点,我们提出了一种新颖的方法——专家混合提示微调 (MEPT),作为一个有效且高效的流形映射框架。MEPT 利用专家混合架构,通过集成多个提示专家来自适应地学习多样且非平稳的数据分布。实证评估表明,MEPT 在 SuperGLUE 基准上优于多种最先进的参数高效基线方法,在平均准确率上取得了显著提升(例如 1.94%),同时将激活的提示数量显著减少了 79.25%。MEPT 的有效性得到了流形学习理论见解的支持,并通过神经激活通路可视化结果得到了验证。我们的代码可在 https://runjia.tech/emnlp_mept/ 获取。
引用
@article{arxiv.2509.00996,
title = {MEPT: Mixture of Expert Prompt Tuning as a Manifold Mapper},
author = {Runjia Zeng and Guangyan Sun and Qifan Wang and Tong Geng and Sohail Dianat and Xiaotian Han and Raghuveer Rao and Xueling Zhang and Cheng Han and Lifu Huang and Dongfang Liu},
journal= {arXiv preprint arXiv:2509.00996},
year = {2025}
}
备注
EMNLP 2025