分离技能与概念以实现新颖视觉问答
计算机视觉与模式识别
2021-07-21 v1 计算与语言
机器学习
摘要
对分布外数据的泛化一直是视觉问答(VQA)模型的一个问题。为衡量对新问题的泛化能力,我们提出将其分离为“技能”与“概念”。“技能”是视觉任务,如计数或属性识别,并被应用于问题中提及的“概念”,如物体与人。VQA 方法应当能够以新颖方式组合技能与概念,无论该特定组合是否在训练中被见过,然而我们证明现有模型在处理新组合方面仍有很大改进空间。我们提出了一种学习组合技能与概念的新方法,其通过在模型内隐式分离这两个因素,学习接地概念表示并将技能的编码与概念的编码解耦。我们以不依赖外部标注、且可从无标注图像-问题对学习的新型对比学习过程来强制这些性质。实验证明了我们的方法在提升组合与接地性能方面的有效性。
引用
@article{arxiv.2107.09106,
title = {Separating Skills and Concepts for Novel Visual Question Answering},
author = {Spencer Whitehead and Hui Wu and Heng Ji and Rogerio Feris and Kate Saenko},
journal= {arXiv preprint arXiv:2107.09106},
year = {2021}
}
备注
Paper at CVPR 2021. 14 pages, 7 figures