利用多线索求解视觉Madlibs
计算机视觉与模式识别
2016-08-12 v1
摘要
本文聚焦于回答来自Visual Madlibs数据集的填空式选择题。先前视觉问答(VQA)的方法主要使用在ImageNet数据集上训练的网络所提取的通用图像特征,尽管问题范围广泛。相反,我们的方法采用源自针对场景分类、人物活动预测及人物与物体属性预测等专门任务训练的网络的特征。我们还提出一种方法,用于选择与评估某个假定答案的恰当性相关的图像子区域。视觉特征既从整幅图像也从局部区域计算,而句子则使用简单的归一化典型相关分析(CCA)模型映射至公共空间。我们的结果显示相较先前最优水平有显著提升,并表明回答不同问题类型受益于考察多种图像线索并精心选择信息丰富的图像子区域。
引用
@article{arxiv.1608.03410,
title = {Solving Visual Madlibs with Multiple Cues},
author = {Tatiana Tommasi and Arun Mallya and Bryan Plummer and Svetlana Lazebnik and Alexander C. Berg and Tamara L. Berg},
journal= {arXiv preprint arXiv:1608.03410},
year = {2016}
}
备注
accepted at BMVC 2016