中文

面向准确和高效临床辅助的MambaFormer:基于token级别引导的混合专家路由

计算机视觉与模式识别 2026-01-06 v1 人工智能 计算与语言

摘要

大型语言模型(LLM)在实际临床应用中的部署受限于计算成本与线性时间模型效率之间的根本权衡。为此,我们提出一种基于LLM的MambaFormer混合 Mixture-of-Experts(MoE)框架,用于高效的医学问答(QA)和临床辅助。MambaFormer采用轻量级门控机制,对token进行水平动态路由,以针对短而复杂查询路由到定制化Transformer专家(ET5),或针对长期高吞吐序列路由到状态空间模型专家(EMamba)。该定制EMamba和ET5模型针对输入序列维度、嵌入结构、序列长度和目标特定输出头进行定制化,并通过迁移学习在全新的定制DentalQA数据集上进行微调。此外,智能路由决策由token嵌入的上下文复杂度、归一化序列长度和领域感知特征驱动,从而强制在推理延迟和预测精度之间实现帕累托最优权衡。Furthermore,本文提出一种新型基于效用引导的多目标损失,联合优化决策、路由器参数、路由行为、专家利用情况和计算成本,通过自适应调节token级别的专家激活。最后,对所提MambaFormer在全新的定制DentalQA和PubMedQA数据集上进行交叉验证(holdout)进行医学QA,并与最先进的技术进行比较。该方法在准确率(BERTScore = 0.9180)和超低延迟(0.077秒)方面均优于先前技术,实现T5-Large的24.4倍加速,为资源受限的临床部署提供可扩展解决方案。

关键词

引用

@article{arxiv.2601.01260,
  title  = {MambaFormer: Token-Level Guided Routing Mixture-of-Experts for Accurate and Efficient Clinical Assistance},
  author = {Hamad Khan and Saddam Hussain Khan},
  journal= {arXiv preprint arXiv:2601.01260},
  year   = {2026}
}

备注

28 Pages, Tables 12, Figure 09