中文

通过适配掩码视觉模型实现高效医学视觉-语言对齐

计算机视觉与模式识别 2025-06-11 v1 人工智能 机器学习

摘要

通过跨模态对比学习进行医学视觉-语言对齐,在图像-文本匹配任务(如检索和零样本分类)中展现出有前景的性能。然而,传统的基于CLIP的跨模态对比学习方法受限于次优的视觉表示能力,这也限制了它们在视觉-语言对齐中的有效性。相比之下,尽管通过多模态掩码建模预训练的模型难以进行直接的跨模态匹配,但它们在视觉表示方面表现出色。为了解决这一矛盾,我们提出了ALTA(通过适配进行对齐),这是一种高效的医学视觉-语言对齐方法,仅使用约8%的可训练参数和不到掩码记录建模所需计算消耗的1/5。ALTA通过适配来自掩码记录建模的预训练视觉模型,在检索和零样本分类等视觉-语言匹配任务中实现了卓越的性能。此外,我们整合了时间多视图X光片输入,以增强X光片与其报告中相应描述之间的信息一致性,进一步改善了视觉-语言对齐。实验评估表明,ALTA在文本到图像准确率上比性能最佳的同类方法高出超过4个绝对百分点,在图像到文本检索准确率上高出约6个绝对百分点。在高效对齐过程中对视觉-语言模型的适配也促进了更好的视觉和语言理解。代码已公开于https://github.com/DopamineLcy/ALTA。

引用

@article{arxiv.2506.08990,
  title  = {Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models},
  author = {Chenyu Lian and Hong-Yu Zhou and Dongyun Liang and Jing Qin and Liansheng Wang},
  journal= {arXiv preprint arXiv:2506.08990},
  year   = {2025}
}

备注

TMI 2025