用于动作与人-物交互的学习模型及其向问答的迁移
计算机视觉与模式识别
2016-07-29 v2
摘要
本文提出利用局部和全局上下文在静态图像中进行人体活动标签预测的深层卷积网络模型,在两个各含数百标签的近期数据集上取得了最先进的性能。我们使用多示例学习(multiple instance learning)来处理单个人员实例层面缺乏监督的问题,并使用加权损失来处理不平衡的训练数据。此外,我们展示了在这些数据集上训练的专用特征如何用于提高视觉问答(VQA)任务的准确率,形式为多选题填空问题(Visual Madlibs)。具体而言,我们处理两类关于人物活动和人-物关系的问题,并展示相比在ImageNet分类任务上训练的通用特征有所改进。
引用
@article{arxiv.1604.04808,
title = {Learning Models for Actions and Person-Object Interactions with Transfer to Question Answering},
author = {Arun Mallya and Svetlana Lazebnik},
journal= {arXiv preprint arXiv:1604.04808},
year = {2016}
}