中文

SparseDoctor:基于稀疏专家增强的高效医疗聊天机器人

计算与语言 2025-09-23 v2 人工智能

摘要

大语言模型(LLM)在医学问答和临床决策方面取得了显著进展,推动了个性化虚拟医生在社会中的效率和普及。然而,传统的 LLM 微调策略需要更新数十亿参数,显著增加训练成本,包括训练时间和资源成本。为提升当前医疗 LLM 的效率和效果,并探索其在医学领域表示能力的边界,除传统数据视角下的微调策略(即监督式微调或基于人类反馈的强化学习)外,我们设计了一种新型稀疏医疗 LLM,名为 SparseDoctor,采用对比学习增强的 LoRA-MoE(低秩适应-混合专家)架构。为此,我们构建了自动路由机制,能够在对比学习监督下科学地在不同 LoRA 专家之间分配计算资源。此外,我们还引入了一种新的专家记忆队列机制,以进一步提升整体框架的效率,并防止训练期间的内存溢出。我们在三个典型医学基准测试上进行了全面评估:CMB、CMExam 和 CMMLU-Med。实验结果表明,所提出的 LLM 在诸如 HuatuoGPT 系列等强大基线上 consistently 取得优异表现。

关键词

引用

@article{arxiv.2509.14269,
  title  = {SparseDoctor: Towards Efficient Chat Doctor with Mixture of Experts Enhanced Large Language Models},
  author = {Jianbin Zhang and Yulin Zhu and Wai Lun Lo and Richard Tai-Chiu Hsung and Harris Sik-Ho Tsang and Kai Zhou},
  journal= {arXiv preprint arXiv:2509.14269},
  year   = {2025}
}