ExGra-Med:用于医疗视觉语言模型的扩展上下文图对齐
机器学习
2025-11-10 v4
摘要
最先进的医疗多模态大语言模型(med-MLLMs),如 LLaVA-Med 和 BioMedGPT,主要依赖扩大模型规模和数据量进行训练,训练目标主要为自回归目标。然而,我们发现,这种方法可能导致视觉语言对齐较弱,使这些模型过度依赖高成本的指令跟随数据。为此,我们提出 ExGra-Med,一种新的多图对齐框架,通过在潜在空间中联合对齐图像、指令响应和扩展标题,推进语义定位和跨模态一致性。为适应大型 LLM(如 LLaMA-7B),我们 developed an efficient end-to-end training scheme using black-box gradient estimation,实现快速可扩展的优化。经验上,ExGra-Med仅使用 10% 的预训练数据即可匹配 LLaVA-Med 的性能,在 VQA-RAD 上实现 20.13% 的提升,并接近全数据性能。它还在视觉聊天和零样本分类任务中超越了 BioMedGPT 和 RadFM 等强大基线,展示了其在医疗 AI 中实现高质量视觉语言集成的高效性。
引用
@article{arxiv.2410.02615,
title = {ExGra-Med: Extended Context Graph Alignment for Medical Vision-Language Models},
author = {Duy M. H. Nguyen and Nghiem T. Diep and Trung Q. Nguyen and Hoang-Bao Le and Tai Nguyen and Tien Nguyen and TrungTin Nguyen and Nhat Ho and Pengtao Xie and Roger Wattenhofer and James Zou and Daniel Sonntag and Mathias Niepert},
journal= {arXiv preprint arXiv:2410.02615},
year = {2025}
}
备注
Accepted at NeurIPS 2025