DiN:用于鲁棒医学视觉问答的扩散模型——应对语义噪声标签
计算机视觉与模式识别
2025-03-25 v1
摘要
医学视觉问答(Med-VQA)系统有助于解读包含关键临床信息的医学图像。然而,噪声标签和高质量数据集有限的挑战仍未得到充分探索。为解决这一问题,我们通过模拟人类误标注并使用语义设计的噪声类型,建立了首个医学视觉问答噪声标签基准。更重要的是,我们提出了DiN框架,利用扩散模型来处理医学视觉问答中的噪声标签。与直接预测答案的主流基于分类的视觉问答方法不同,我们的答案扩散器(AD)模块采用由粗到细的过程,通过扩散模型细化答案候选以提高准确性。答案条件生成器(ACG)进一步通过将答案嵌入与融合的图像-问题特征相结合来生成任务特定的条件信息,从而增强这一过程。为应对标签噪声,我们的噪声标签精炼(NLR)模块引入了鲁棒损失函数和动态答案调整,进一步提升AD模块的性能。
引用
@article{arxiv.2503.18536,
title = {DiN: Diffusion Model for Robust Medical VQA with Semantic Noisy Labels},
author = {Erjian Guo and Zhen Zhao and Zicheng Wang and Tong Chen and Yunyi Liu and Luping Zhou},
journal= {arXiv preprint arXiv:2503.18536},
year = {2025}
}