使用功能面向对象网络的长活动视频理解
计算机视觉与模式识别
2018-07-04 v1
摘要
视频理解是计算机视觉中最具挑战性的课题之一。本文提出一个四阶段视频理解流程,用于同时识别视频中的所有原子动作及单一进行中的活动。该流程利用视频中的对象与运动以及基于图的知识表示网络作为先验参考。训练两个深度网络来识别与动作相关的每个视频序列中的对象与运动。随后使用低级图像特征识别该视频序列中感兴趣的对象。根据对象在动作中的参与程度为感兴趣对象分配置信度分数,并根据将视频中进行中的动作分类为运动类别的深度神经网络结果为运动类别分配置信度分数。利用知识表示网络、对象置信度和运动置信度,为每个与动作相关的候选功能单元计算置信度分数。因此每个动作关联一个功能单元,并进一步评估动作序列以识别视频中单一进行中的活动。流程中使用的知识表示称为功能面向对象网络,这是一种基于图的网络,可用于编码关于操作任务的知识。我们在烹饪视频数据集上进行了实验,以测试所提算法在动作推断与活动分类上的表现。实验表明,使用功能面向对象网络显著改善了视频理解。
引用
@article{arxiv.1807.00983,
title = {Long Activity Video Understanding using Functional Object-Oriented Network},
author = {Ahmad Babaeian Jelodar and David Paulius and Yu Sun},
journal= {arXiv preprint arXiv:1807.00983},
year = {2018}
}
备注
12 pages, 12 figures