中文

通过自动注意力对齐调优提升医学视觉语言模型的效果

计算机视觉与模式识别 2025-05-27 v1

摘要

医学大型视觉语言模型(Med-LVLMs)常表现出次优的注意力分布,导致幻觉或不准确的输出。现有缓解方法主要依赖推理时干预,注意力适应性有限,或需要额外监督。为此,我们提出 A3^3Tune,即自动注意力对齐调优(A3^3Tune)的一种新型微调框架。A3^3Tune 利用 SAM 的零射注意标签,借助 BioMedCLIP 将其细化为提示感知标签,然后有针对性地修改视觉关键注意力头以提高对齐度,同时最小化干扰。此外,我们引入 A3^3MoE 模块,实现对注意力调优在不同提示和图像之间的自适应参数选择。广泛的实验在医学 VQA 和报告生成基准测试上表明,A3^3Tune 优于最先进的基线方法,实现了增强的注意力分布和 Med-LVLMs 性能。

关键词

引用

@article{arxiv.2505.18503,
  title  = {Focus on What Matters: Enhancing Medical Vision-Language Models with Automatic Attention Alignment Tuning},
  author = {Aofei Chang and Le Huang and Alex James Boyd and Parminder Bhatia and Taha Kass-Hout and Cao Xiao and Fenglong Ma},
  journal= {arXiv preprint arXiv:2505.18503},
  year   = {2025}
}

备注

Accepted to ACL2025 (main)