RoiMAM:用于高效视觉-语言理解的感兴趣区域医学注意力模型
计算机视觉与模式识别
2026-05-18 v1
摘要
视觉-语言模型 (VLM) 通过联合解释图像和文本,促进了医学视觉问答 (MedVQA) 的发展。然而,现有模型通常依赖于大型架构和封闭式答案,这限制了其效率和潜在的临床适用性。为了克服这些缺点,我们引入了 RoiMAM,一个高效的 VLM。它集成了一个无需训练的 ROI 生成模块和语义选择性抑制,以聚焦于病变相关区域,并配有一个文本提示增强器模块,该模块在不引入训练参数的情况下提供模态特定的上下文。与广泛使用的 MedVInT-TD 模型相比,我们的设计在不到 20% 的模型大小下实现了高效且准确的诊断,同时在 SLAKE 上准确率提高了约 2%,在 PMC-VQA 上提高了约 4.6%。
引用
@article{arxiv.2605.15561,
title = {RoiMAM: Region-of-Interest Medical Attention Model for Efficient Vision-Language Understanding},
author = {Jiayan Yang and Zhuoyu Wu and Wenqi Fang},
journal= {arXiv preprint arXiv:2605.15561},
year = {2026}
}
备注
under revision