中文

MoLoRA:基于Per-Token适配器路由的可组合专化

计算与语言 2026-03-18 v1 人工智能

摘要

多适配器服务系统将整个序列路由到单个适配器,迫使在请求跨越多个领域时做出选择。这一假设在两个重要场景中失败:(1)多模态生成时,文本和图像标记需要在同一序列内的不同适配器;(2)混合能力请求(如“编写解决此方程的程序”)需要来自多个专用适配器的专业知识。我们引入逐标记路由,根据词汇结构(用于多模态模型)或学习的门控(用于语义专化)将 individual tokens路由到适配器。逐标记路由在代数上最优,实现 N 个标记的工作量,而对于 K 个适配器类型的 per-sequence routing 只需 K·N。我们的关键贡献是 MoLoRA(Mixture of LoRA),它支持可组合专化:加载多个领域特定适配器,让学习的路由器按标记选择 appropriate adapter。我们演示专化显著优于规模:MoLoRA 使 Qwen3-1.7B 能超过 Qwen3-8B 在四个推理基准测试中,同时体积小 4.7 倍。这实现了推理时的模块化专业知识:独立训练聚焦 LoRAs,无需重新训练即可组合它们,通过加载新适配器来添加新能力。

关键词

引用

@article{arxiv.2603.15965,
  title  = {MoLoRA: Composable Specialization via Per-Token Adapter Routing},
  author = {Shrey Shah and Justin Wagle},
  journal= {arXiv preprint arXiv:2603.15965},
  year   = {2026}
}