中文

通过对齐蒸馏提升医学大型视觉语言模型

计算机视觉与模式识别 2025-12-23 v1 人工智能

摘要

医学大型视觉语言模型(Med-LVLMs)在临床应用中显示出良好的性能,但常因视觉理解对齐不良而产生幻觉输出。本文识别了导致该问题的两个根本性局限性:视觉表征学习不足以及视觉注意力对齐不良。为解决这些问题,我们提出了MEDALIGN—a种简单轻量级的对齐蒸馏框架,将来自领域特定对比语言-图像预训练(CLIP)模型的视觉对齐知识传递给Med-LVLMs。MEDALIGN引入两种蒸馏损失:基于视觉标记级别相似性结构的空间感知视觉对齐损失,以及引导注意力聚焦于诊断相关区域的注意力感知蒸馏损失。在医学报告生成和医学视觉问答(VQA)基准上的大量实验表明,MEDALIGN consistently提高了两项性能和可解释性,生成更具视觉依托性的输出。

关键词

引用

@article{arxiv.2512.18554,
  title  = {Enhancing Medical Large Vision-Language Models via Alignment Distillation},
  author = {Aofei Chang and Ting Wang and Fenglong Ma},
  journal= {arXiv preprint arXiv:2512.18554},
  year   = {2025}
}

备注

Accepted to AAAI'2026 (Main track)