Hulu-Med:面向全方位医学视觉语言理解的透明通用模型
计算机视觉与模式识别
2025-11-06 v2
摘要
临床决策需整合异构数据,包括医学文本、2D图像、3D体数据及视频,而现有AI系统难以统一这些信号,限制了实际应用价值。本文引入Hulu-Med,一个透明、通用的医学视觉语言模型(VLM),旨在统一语言-only、2D/3D视觉语言及视频理解于单一架构之内。Hulu-Med在由精选数据构成的1670万样本语料上训练,数据全部来自公开或合成来源,覆盖12大解剖系统及14种医学影像模态。Hulu-Med采用医学感知型token削减策略,对3D和视频输入实现最高55%的视觉token削减,提升跨模态效率,使7B至32B参数规模的模型在约4000至4万GPU小时内即可完成训练。在30个公开的领域内外医学基准测试中——涵盖文本推理、视觉问答、报告生成、多语言对话、视频理解及罕见疾病诊断——Hulu-Med在27个基准测试中超越现有开源模型,在16个基准测试中领先于专有系统如GPT-4o。尽管为VLM,Hulu-Med仍超越GPT-4o并与GPT-o1在仅文本的HealthBench上持平。首次在学术界,我们提供了面向全方位医学视觉语言理解的完全透明、可复现且成本效益极佳的完整流程,包括数据 curated、训练程序及模型参数。代码与模型已发布于https://github.com/ZJUI-AI4H/Hulu-Med。
引用
@article{arxiv.2510.08668,
title = {Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding},
author = {Songtao Jiang and Yuan Wang and Sibo Song and Tianxiang Hu and Chenyi Zhou and Bin Pu and Yan Zhang and Zhibo Yang and Yang Feng and Joey Tianyi Zhou and Jin Hao and Zijian Chen and Ruijia Wu and Tao Tang and Junhui Lv and Hongxia Xu and Hongwei Wang and Jun Xiao and Bin Feng and Fudong Zhu and Kenli Li and Weidi Xie and Jimeng Sun and Jian Wu and Zuozhu Liu},
journal= {arXiv preprint arXiv:2510.08668},
year = {2025}
}