中文

TuckA:用于高效微调的层次化紧凑张量专家

机器学习 2025-11-11 v1 人工智能

摘要

为下游任务高效微调预训练模型是基础模型时代的关键挑战。参数高效微调(PEFT)提供了可行的解决方案,通过仅更新每层少量适应权重即可实现与完全微调相当的性能。传统 PEFT 方法通常依赖单个专家,其中适应权重为低秩矩阵。然而,对于复杂任务,数据固有的多样性对此类模型构成了重大挑战,因为单个适应权重无法充分捕捉所有样本的特征。为此,我们探索如何将多个小型适应专家整合到紧凑结构中以对抗大型适配器。具体而言,我们提出 Tucker 适应方法(TuckA),该方法具有四个关键特性:(i)我们使用 Tucker 分解创建紧凑的 3D 张量,其中每个切片自然作为一个专家。该分解的低秩特性确保随着专家数量的增加,参数规模高效地扩展。(ii)我们引入层次化策略,将这些专家组织为不同粒度的组,从而允许模型捕捉本地和全局数据模式。(iii)我们开发了高效的批量级路由机制,该机制将路由器的规模在每个适配层级路由时缩小 LL 倍(其中 LL 为适配层数)。(iv)我们提出数据感知初始化,以实现基于理论分析的无损专家负载平衡。在自然语言理解、图像分类和数学推理等基准测试上的大量实验表明,TuckA 的有效性,为 PEFT 问题提供了一种新颖且高效的解决方案。

关键词

引用

@article{arxiv.2511.06859,
  title  = {TuckA: Hierarchical Compact Tensor Experts for Efficient Fine-Tuning},
  author = {Qifeng Lei and Zhiyong Yang and Qianqian Xu and Cong Hua and Peisong Wen and Qingming Huang},
  journal= {arXiv preprint arXiv:2511.06859},
  year   = {2025}
}