中文

通过梯度引导模型扰动增强医疗视觉问答任务的泛化能力

计算机视觉与模式识别 2024-03-06 v1 多媒体

摘要

利用预训练视觉语言模型已成为提高下游视觉问答(VQA)应用性能的广泛采用方法。然而,在专业的医疗 VQA 领域,可用数据的稀缺构成了实现可靠模型泛化的重大障碍。许多方法已被提出以增强模型泛化能力,分别从以数据为中心和以模型为中心的角度解决该问题。数据增强技术常用于丰富数据集,而各种正则化方法旨在防止模型过拟合,特别是在有限数据样本上训练时。在本文中,我们引入了一种方法,该方法在预训练和微调阶段将梯度引导的参数扰动整合到多模态模型的视觉编码器中,以改善下游医疗 VQA 任务的模型泛化能力。该微小扰动通过与优化景观中移动平均梯度方向对齐(即与优化器历史更新方向相反)自适应生成,随后注入模型的视觉编码器。结果表明,即使在预训练图像描述数据集显著较小的情况下,我们的方法在 VQA-RAD 和 SLAKE 数据集上均取得了具有竞争力的结果。

关键词

引用

@article{arxiv.2403.02707,
  title  = {Enhancing Generalization in Medical Visual Question Answering Tasks via Gradient-Guided Model Perturbation},
  author = {Gang Liu and Hongyang Li and Zerui He and Shenjun Zhong},
  journal= {arXiv preprint arXiv:2403.02707},
  year   = {2024}
}