中文

BioD2C:面向生物医学VQA的双层语义一致性约束框架

计算机视觉与模式识别 2025-03-05 v1 人工智能

摘要

生物医学视觉问答已被广泛研究,并在辅助医疗诊断等领域展现出显著的应用价值与潜力。尽管取得了成功,当前的生物医学VQA模型仅在大语言模型内部的模型层面进行多模态信息交互,导致在处理复杂任务时多模态语义对齐欠佳。为解决这一问题,我们提出了BioD2C:一种用于生物医学VQA的新型双层语义一致性约束框架,该框架在模型层面和特征层面均实现了双层语义交互对齐,使模型能够基于问题自适应地学习视觉特征。具体而言,我们首先通过图像-文本融合机制将文本特征整合到视觉特征中,作为特征层面的语义交互,获得以给定文本为条件的视觉特征;然后引入一种基于文本队列的跨模态软语义损失函数,以进一步将图像语义与问题语义对齐。具体而言,在本工作中,我们建立了一个新数据集BioVGQ,通过过滤人工修改的图像并将问答对与多模态上下文对齐,来解决先前数据集中固有的偏差,并在该数据集上训练我们的模型。大量实验结果表明,BioD2C在多个下游数据集上取得了SOTA性能,展示了其鲁棒性、泛化能力以及推进生物医学VQA研究的潜力。

关键词

引用

@article{arxiv.2503.02476,
  title  = {BioD2C: A Dual-level Semantic Consistency Constraint Framework for Biomedical VQA},
  author = {Zhengyang Ji and Shang Gao and Li Liu and Yifan Jia and Yutao Yue},
  journal= {arXiv preprint arXiv:2503.02476},
  year   = {2025}
}