视频中近未来活动的预测与描述
计算机视觉与模式识别
2021-05-28 v5
摘要
现有关于人类活动分析的工作大多集中于从完整或部分观测中识别或早期识别活动标签。类似地,几乎所有现有的视频字幕方法都集中于视频中已观测到的事件。预测未来活动的标签和字幕,且所预测活动无任何帧被观测到,是一个具有挑战性的问题,其在需要预期响应的应用中十分重要。在这项工作中,我们提出了一个能够推断未来活动序列标签和字幕的系统。我们提出的用于未来活动序列标签预测的网络具有三个分支:第一分支提取场景中存在的物体的视觉特征,第二分支提取已观测的序列活动特征,第三分支捕获最后观测到的活动特征。随后,使用基于序列到序列学习的方法将预测的标签和观测到的场景上下文映射到有意义的字幕。在四个具有挑战性的活动分析数据集和一个视频描述数据集上的实验表明,我们的标签预测方法与最先进(state-of-the-art)方法性能相当,而我们的字幕框架优于最先进方法。
引用
@article{arxiv.1908.00943,
title = {Prediction and Description of Near-Future Activities in Video},
author = {Tahmida Mahmud and Mohammad Billah and Mahmudul Hasan and Amit K. Roy-Chowdhury},
journal= {arXiv preprint arXiv:1908.00943},
year = {2021}
}
备注
15 pages, 4 figures, 14 tables