对齐、挖掘与融合:面向医学视觉问答的表示对齐、难负样本挖掘与选择性知识融合
计算机视觉与模式识别
2025-10-13 v1
摘要
医学视觉问答(Med-VQA)是一项具有挑战性的任务,需要对医学图像和文本问题都有深入理解。尽管近期利用医学视觉-语言预训练(Med-VLP)的工作在 Med-VQA 任务上展现了强劲性能,但仍缺乏模态对齐的统一解决方案,且难负样本问题尚未得到充分探索。此外,Med-VQA 中常用的知识融合技术可能引入无关信息。在这项工作中,我们通过三个关键贡献提出了一种框架来解决这些挑战:(1)利用对比学习和最优传输理论等方法,在多个层级、模态、视图和阶段上实现异构模态对齐的统一解决方案;(2)一种利用软标签进行多模态对齐并强制难负样本对区分的难负样本挖掘方法;(3)一个用于 Med-VQA 的门控交叉注意力模块,将答案词汇表作为先验知识并从中选择相关信息。我们的框架在广泛使用的 Med-VQA 数据集上(如 RAD-VQA、SLAKE、PathVQA 和 VQA-2019)超越了先前的最先进方法。
引用
@article{arxiv.2510.08791,
title = {Alignment, Mining and Fusion: Representation Alignment with Hard Negative Mining and Selective Knowledge Fusion for Medical Visual Question Answering},
author = {Yuanhao Zou and Zhaozheng Yin},
journal= {arXiv preprint arXiv:2510.08791},
year = {2025}
}
备注
CVPR2025 Paper