中文

弱标记教学视频中任务识别与动作分割的层次化建模

计算机视觉与模式识别 2021-10-13 v1

摘要

本文关注弱标记教学视频中的任务识别与动作分割,其中训练时仅提供视频级动作的有序序列。我们提出了一种双流框架,利用语义与时间层次结构来识别教学视频中的顶层任务。此外,我们提出了一种新颖的自顶向下弱监督动作分割方法,其中预测的任务被用于约束细粒度动作序列的推断。在流行的 Breakfast 和 Cooking 2 数据集上的实验结果表明,我们的双流层次任务建模在所有数据集与指标上均显著优于现有方法的顶层任务识别。此外,在提出的自顶向下动作分割方法中采用我们的任务识别框架持续提升了当前最优水平,同时将分割推断时间减少了 80–90%。

关键词

引用

@article{arxiv.2110.05697,
  title  = {Hierarchical Modeling for Task Recognition and Action Segmentation in Weakly-Labeled Instructional Videos},
  author = {Reza Ghoddoosian and Saif Sayed and Vassilis Athitsos},
  journal= {arXiv preprint arXiv:2110.05697},
  year   = {2021}
}

备注

Accepted in WACV 2022