采纳 HINT:利用解释使视觉与语言模型更具基础性
计算机视觉与模式识别
2019-10-29 v2
摘要
许多视觉与语言模型存在视觉基础性差的问题——往往退而依赖易于学习的语言先验,而非基于图像中的视觉概念做出决策。在这项工作中,我们提出了一种名为人类重要性感知网络微调(Human Importance-aware Network Tuning, HINT)的通用方法,该方法有效利用人类示范来改善视觉基础性。HINT 鼓励深度网络对与人类相同的输入区域保持敏感。我们的方法优化了人类注意力图与基于梯度的网络重要性之间的对齐——确保模型不仅学会去“看”,而且在做出预测时依赖人类认为与任务相关的视觉概念。我们将 HINT 应用于视觉问答和图像描述任务,在仅使用 6% 训练数据的人类注意力示范的情况下,在惩罚过度依赖语言先验的划分(VQA-CP 和鲁棒描述)上优于顶级方法。
引用
@article{arxiv.1902.03751,
title = {Taking a HINT: Leveraging Explanations to Make Vision and Language Models More Grounded},
author = {Ramprasaath R. Selvaraju and Stefan Lee and Yilin Shen and Hongxia Jin and Shalini Ghosh and Larry Heck and Dhruv Batra and Devi Parikh},
journal= {arXiv preprint arXiv:1902.03751},
year = {2019}
}
备注
Published at ICCV'2019