面向全球医疗领域的大型语言模型
计算与语言
2026-01-06 v1
摘要
尽管医疗技术不断进步,但全球卫生资源的分配仍不均衡。大型语言模型(LLM)的发展已深刻改变了医疗领域的格局,前景广阔,可提高医疗质量并扩大全球医疗信息的获取。然而,现有的LLM主要在高资源语言上训练,限制了其在全球医疗场景中的适用性。为此,我们构建了GlobMed——一个规模超过50万条、涵盖12种语言(包括4种低资源语言)的大型多语言医疗数据集。基于此,我们建立了GlobMed-Bench,对56个现有的专有和开源权重LLM进行系统评估,涵盖多种多语言医疗任务,揭示了跨语言的显著性能差异,尤其在低资源语言方面。此外,我们引入了GlobMed-LLM一套多语言医学LLM,这些模型在GlobMed上训练,参数规模从17亿到80亿不等。GlobMed-LLM相对于基线模型实现了平均40%以上的性能提升,在低资源语言上的性能提升超过三倍。综上,这些资源为推动LLM在全球范围内的公平发展和应用提供了重要基础,使更广泛的语言社区能够从技术进步中受益。
引用
@article{arxiv.2601.02186,
title = {Toward Global Large Language Models in Medicine},
author = {Rui Yang and Huitao Li and Weihao Xuan and Heli Qi and Xin Li and Kunyu Yu and Yingjian Chen and Rongrong Wang and Jacques Behmoaras and Tianxi Cai and Bibhas Chakraborty and Qingyu Chen and Lionel Tim-Ee Cheng and Marie-Louise Damwanza and Chido Dzinotyiwei and Aosong Feng and Chuan Hong and Yusuke Iwasawa and Yuhe Ke and Linah Kitala and Taehoon Ko and Jisan Lee and Irene Li and Jonathan Chong Kai Liew and Hongfang Liu and Lian Leng Low and Edison Marrese-Taylor and Yutaka Matsuo and Isheanesu Misi and Yilin Ning and Jasmine Chiat Ling Ong and Marcus Eng Hock Ong and Enrico Petretto and Hossein Rouhizadeh and Abiram Sandralegar and Oren Schreier and Iain Bee Huat Tan and Patrick Tan and Daniel Shu Wei Ting and Junjue Wang and Chunhua Weng and Matthew Yu Heng Wong and Fang Wu and Yunze Xiao and Xuhai Xu and Qingcheng Zeng and Zhuo Zheng and Yifan Peng and Douglas Teodoro and Nan Liu},
journal= {arXiv preprint arXiv:2601.02186},
year = {2026}
}
备注
182 pages, 65 figures