结合多线索的视觉 Madlibs 问答
计算机视觉与模式识别
2018-02-09 v3
摘要
本文提出一种从 Visual Madlibs 数据集回答填空选择题的方法。我们的方法未使用在 ImageNet 分类任务上训练的通用且常用的表示,而是采用了为专门任务(如场景识别、人物活动分类和属性预测)训练的网络组合。我们还提出一种从候选答案中定位短语的方法,以便为特征提取提供空间支持。我们通过归一化典型相关分析 (nCCA) 将这些特征与候选答案一起映射到联合嵌入空间。最后,我们求解一个优化问题,以学习组合来自基于多线索训练的 nCCA 模型的分数,从而选择最佳答案。大量实验结果表明相较先前最先进方法有显著改进,并证实回答广泛类型的问题受益于检查多种图像线索以及仔细选择特征提取的空间支持。
引用
@article{arxiv.1611.00393,
title = {Combining Multiple Cues for Visual Madlibs Question Answering},
author = {Tatiana Tommasi and Arun Mallya and Bryan Plummer and Svetlana Lazebnik and Alexander C. Berg and Tamara L. Berg},
journal= {arXiv preprint arXiv:1611.00393},
year = {2018}
}
备注
submitted to IJCV -- under review