从已知到未知:迁移知识以回答关于新颖视觉与语义概念的问题
计算机视觉与模式识别
2018-12-03 v1
摘要
当前的视觉问答(VQA)系统能够回答关于“已知”视觉内容的智能问题。然而,当推理时呈现关于视觉与语言上“未知”概念的问题(“开放世界”场景)时,其性能显著下降。一个实用的 VQA 系统应能在真实世界设定中处理新颖概念。为解决此问题,我们提出一种基于样例的方法,将学习(即知识)从先前“已知”概念迁移以回答关于“未知”概念的问题。我们学习一个高度判别的联合嵌入空间,其中视觉与语义特征相融合以给出统一表示。一旦向模型呈现新颖概念,它便在联合嵌入空间中从样例集中寻找最匹配项。该辅助信息与给定的图像-问题对一起以分层方式精炼视觉注意力。由于在大尺度数据集上处理高维样例可能是重大挑战,我们引入一种高效匹配方案,使用紧凑特征描述进行搜索与检索。为评估我们的模型,我们提出 VQA 的新划分,将未知视觉与语义概念从训练集中分离。我们的方法在提出的开放世界 VQA 数据集与标准 VQA 数据集上均较最先进的 VQA 模型表现出显著改进。
引用
@article{arxiv.1811.12772,
title = {From Known to the Unknown: Transferring Knowledge to Answer Questions about Novel Visual and Semantic Concepts},
author = {Moshiur R Farazi and Salman H Khan and Nick Barnes},
journal= {arXiv preprint arXiv:1811.12772},
year = {2018}
}