面向弱标签视频段级对齐的动作时长预测
计算机视觉与模式识别
2020-11-23 v1
摘要
本文关注弱监督动作对齐问题,其中训练时仅提供视频级动作的有序序列。我们提出了一种新颖的时长网络(Duration Network),其捕获视频的短时时间窗口,并学习基于给定动作类型的时间粒度,在任意时刻预测该动作的剩余时长。进一步,我们引入段级束搜索(Segment-Level Beam Search)以获得最大化后验概率的最佳对齐。段级束搜索仅考虑一组具有更高置信度预测的选定帧,从而高效地对齐动作。实验结果表明,我们对长视频的对齐比现有模型更鲁棒。此外,所提方法在流行的 Breakfast 与 Hollywood Extended 数据集上于某些情况下取得了 SOTA 结果。
引用
@article{arxiv.2011.10190,
title = {Action Duration Prediction for Segment-Level Alignment of Weakly-Labeled Videos},
author = {Reza Ghoddoosian and Saif Sayed and Vassilis Athitsos},
journal= {arXiv preprint arXiv:2011.10190},
year = {2020}
}
备注
Accepted to WACV 2021