基于知识蒸馏克服视觉问答中的语言先验
计算机视觉与模式识别
2025-01-13 v1 计算与语言
摘要
先前的研究指出,视觉问答模型倾向于依赖语言先验进行答案预测。在这种情况下,预测通常依赖于语言捷径,而不是对多模态知识的全面掌握,这削弱了它们的泛化能力。在本文中,我们提出了一种新方法,即 KDAR,利用知识蒸馏来解决 VQA 任务中的先验依赖困境。具体而言,利用来自训练良好的教师模型的软标签所促进的正则化效应,来惩罚对最常见答案的过拟合。作为正则化作用的软标签还提供了语义指导,缩小了候选答案的范围。此外,我们设计了一种自适应的逐样本重加权学习策略,通过动态调整每个样本的重要性来进一步缓解偏差。实验结果表明,我们的方法在 OOD 和 IID 设置下均提升了性能。我们的方法在 VQA-CPv2 分布外基准上取得了最先进的性能,显著优于以前的最先进方法。
引用
@article{arxiv.2501.05690,
title = {Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation},
author = {Daowan Peng and Wei Wei},
journal= {arXiv preprint arXiv:2501.05690},
year = {2025}
}
备注
Accepted to ICME2024