基于自然语言查询的演员与动作视频分割的多模态胶囊路由
计算机视觉与模式识别
2018-12-04 v1
摘要
本文提出一种端到端的胶囊网络,用于视频中演员与动作的像素级定位。该定位基于自然语言查询进行,查询中指定了演员与动作。我们提出将视频与文本输入均以胶囊形式编码,相较于基于标准卷积的特征,胶囊能提供更有效的表示。我们引入一种新颖的基于胶囊的注意力机制,用于融合视频与文本胶囊以实现文本选定的视频分割。该注意力机制通过对视频与文本胶囊进行联合EM路由,实现文本选定的演员与动作定位。现有演员-动作定位工作主要集中于单帧定位而非整段视频。与现有工作不同,我们提出对视频所有帧进行定位。为验证所提网络在视频全帧演员与动作定位上的潜力,我们将现有的演员-动作数据集(A2D)扩展为包含所有帧的标注。实验评估证明了所提胶囊网络在文本选择性演员与动作视频定位中的有效性,并且在基于单帧定位的现有最优(state-of-the-art)工作上也有所提升。
引用
@article{arxiv.1812.00303,
title = {Multi-modal Capsule Routing for Actor and Action Video Segmentation Conditioned on Natural Language Queries},
author = {Bruce McIntosh and Kevin Duarte and Yogesh S Rawat and Mubarak Shah},
journal= {arXiv preprint arXiv:1812.00303},
year = {2018}
}