VILA-M3:利用医学专家知识增强视觉语言模型
计算机视觉与模式识别
2025-03-05 v3
摘要
通用视觉语言模型(VLM)在计算机视觉领域取得了显著进展,但在医疗保健等专业领域表现不足,因为这些领域需要专家知识。在传统计算机视觉任务中,创造性或近似的答案或许可以接受,但在医疗保健领域,精确性至关重要。当前如 Gemini 和 GPT-4o 等大型多模态模型不足以胜任医疗任务,因为它们依赖记忆的互联网知识,而非医疗保健所需的细致专业知识。VLM 通常分三个阶段训练:视觉预训练、视觉语言预训练和指令微调(IFT)。IFT 通常使用通用数据和医疗保健数据的混合进行。相反,我们提出对于医疗 VLM,需要第四阶段的专门 IFT,该阶段聚焦于医疗数据并包含来自领域专家模型的信息。为医疗用途开发的领域专家模型至关重要,因为它们针对特定临床任务进行了专门训练,例如通过分割和分类来检测肿瘤和异常,从而学习医疗数据的细粒度特征——这些特征通常过于复杂,VLM 难以有效捕捉,尤其是在放射学中。本文介绍了一个用于医疗 VLM 的新框架 VILA-M3,通过专家模型利用领域知识。通过实验,我们展示了改进的最先进(SOTA)性能,与先前的 SOTA 模型 Med-Gemini 相比平均提升约 9%,与针对特定任务训练的模型相比提升约 6%。我们的方法强调了领域专业知识在为医疗应用创建精确、可靠的 VLM 中的重要性。
引用
@article{arxiv.2411.12915,
title = {VILA-M3: Enhancing Vision-Language Models with Medical Expert Knowledge},
author = {Vishwesh Nath and Wenqi Li and Dong Yang and Andriy Myronenko and Mingxin Zheng and Yao Lu and Zhijian Liu and Hongxu Yin and Yucheng Tang and Pengfei Guo and Can Zhao and Ziyue Xu and Yufan He and Greg Heinrich and Yee Man Law and Benjamin Simon and Stephanie Harmon and Stephen Aylward and Marc Edgar and Michael Zephyr and Song Han and Pavlo Molchanov and Baris Turkbey and Holger Roth and Daguang Xu},
journal= {arXiv preprint arXiv:2411.12915},
year = {2025}
}