中文

对比与分类:训练鲁棒的 VQA 模型

计算机视觉与模式识别 2021-04-20 v2

摘要

近期的视觉问答(VQA)模型在 VQA 基准上展现出令人印象深刻的性能,但仍对输入问题中的微小语言变化敏感。现有方法通过用来自视觉问题生成模型的问题改写或对抗扰动扩充数据集来解决此问题。这些方法使用组合数据通过最小化标准交叉熵损失来学习答案分类器。为更有效地利用扩充数据,我们基于对比学习近期的成功展开工作。我们提出一种新颖的训练范式(ConClaT),其同时优化交叉熵损失与对比损失。对比损失促使表征对问题中的语言变化鲁棒,而交叉熵损失保持表征用于答案预测的判别力。我们发现优化两种损失——交替或联合——是有效训练的关键。在衡量 VQA 模型对问题人工改写的答案一致性的 VQA-Rephrasings 基准上,ConClaT 相较改进基线将一致性分数(Consensus Score)提升 1.63%。此外,在标准 VQA 2.0 基准上,我们整体将 VQA 准确率提升 0.78%。我们还展示 ConClaT 对所用数据扩充策略的类型不敏感。

关键词

引用

@article{arxiv.2010.06087,
  title  = {Contrast and Classify: Training Robust VQA Models},
  author = {Yash Kant and Abhinav Moudgil and Dhruv Batra and Devi Parikh and Harsh Agrawal},
  journal= {arXiv preprint arXiv:2010.06087},
  year   = {2021}
}