HuatuoGPT-Vision:向大规模多模态 LLM 中注入医学视觉知识
计算机视觉与模式识别
2024-10-01 v4 人工智能
计算与语言
机器学习
摘要
多模态大语言模型(MLLM)如 GPT-4V 的快速发展带来了显著进展。然而,这些模型在医学多模态能力方面仍面临挑战,主要源于医学视觉-文本数据的数量和质量受限,这源于数据隐私 concerns 和高标注成本。虽然已有初创方法利用 PubMed 大规模去标识化的医学图像-文本对来缓解这些限制,但仍因数据内在噪声而不足。为此,我们精炼了来自 PubMed 的医学图像-文本对,并让 MLLM(GPT-4V)以“无盲视”方式对数据进行去噪和重格式化,构建了包含 130 万医学 VQA 样本的 PubMedVision 数据集。我们的验证表明:(1)PubMedVision 能显著提升当前 MLLM 的医学多模态能力,在包括 MMMU 健康与医学轨道在内的基准测试中取得显著提升;(2)由医学专家进行的手动检查和实证结果均验证了我们数据集相较于其他数据构建方法具有更优质的数据质量。使用 PubMedVision,我们训练了一个 34B 参数的医学 MLLM HuatuoGPT-Vision,在医学多模态场景中表现优于开源 MLLM。
引用
@article{arxiv.2406.19280,
title = {HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale},
author = {Junying Chen and Chi Gui and Ruyi Ouyang and Anningzhe Gao and Shunian Chen and Guiming Hardy Chen and Xidong Wang and Ruifei Zhang and Zhenyang Cai and Ke Ji and Guangjun Yu and Xiang Wan and Benyou Wang},
journal= {arXiv preprint arXiv:2406.19280},
year = {2024}
}