稀疏谱 LoRA:用于医学视觉语言模型的路由专家
计算机视觉与模式识别
2026-04-03 v1
摘要
大型视觉语言模型 (VLM) 在通用基准上表现出色,但在医学成像中往往缺乏鲁棒性,其中异质性监督诱导了跨数据集干扰和对数据模式(即监督信号如何混合)的敏感性。在现实的临床工作流程中,数据和任务按顺序到达,因此朴素的持续训练进一步导致灾难性遗忘。为应对这些挑战,我们提出了 MedQwen,一个参数高效的医学 VLM,将谱路由的混合专家 (MoE) 与一个理论上有依据的缩放规则相结合,使低秩更新与完整秩、完全微调的 MoE 对齐,而不改变基础架构。具体而言,我们从预训练权重的非重叠奇异值分解 (SVD) 段初始化每个专家,并引入残差补偿和缩放方案,以实现稳定的专家特化以及在分布偏移下的一致路由。在涵盖视觉问答、报告生成、放射学分类和幻觉缓解的 23 个医学数据集上,MedQwen 实现了强大且可靠的性能:它在零样本分类上接近完全微调的效果,但可训练参数减少了 339 倍,并将顺序遗忘降至约 5%,而强基线方法退化超过 20-50%。
引用
@article{arxiv.2604.01310,
title = {Sparse Spectral LoRA: Routed Experts for Medical VLMs},
author = {Omid Nejati Manzari and Hojat Asgariandehkordi and Taha Koleilat and Yiming Xiao and Hassan Rivaz},
journal= {arXiv preprint arXiv:2604.01310},
year = {2026}
}