通过自动注意力对齐调优提升医学视觉语言模型的效果
计算机视觉与模式识别
2025-05-27 v1
摘要
医学大型视觉语言模型(Med-LVLMs)常表现出次优的注意力分布,导致幻觉或不准确的输出。现有缓解方法主要依赖推理时干预,注意力适应性有限,或需要额外监督。为此,我们提出 ATune,即自动注意力对齐调优(ATune)的一种新型微调框架。ATune 利用 SAM 的零射注意标签,借助 BioMedCLIP 将其细化为提示感知标签,然后有针对性地修改视觉关键注意力头以提高对齐度,同时最小化干扰。此外,我们引入 AMoE 模块,实现对注意力调优在不同提示和图像之间的自适应参数选择。广泛的实验在医学 VQA 和报告生成基准测试上表明,ATune 优于最先进的基线方法,实现了增强的注意力分布和 Med-LVLMs 性能。
引用
@article{arxiv.2505.18503,
title = {Focus on What Matters: Enhancing Medical Vision-Language Models with Automatic Attention Alignment Tuning},
author = {Aofei Chang and Le Huang and Alex James Boyd and Parminder Bhatia and Taha Kass-Hout and Cao Xiao and Fenglong Ma},
journal= {arXiv preprint arXiv:2505.18503},
year = {2025}
}
备注
Accepted to ACL2025 (main)