中文

实时流式视频时间动作分割

计算机视觉与模式识别 2023-10-11 v3

摘要

时间动作分割(TAS)是迈向长视频理解的关键步骤。近期研究遵循基于特征而非原始视频图像信息构建模型的模式。然而,我们指出这些模型训练复杂且限制了应用场景。由于必须在完整视频特征提取完成后才能工作,它们难以实时分割视频中的人体动作。由于实时动作分割任务不同于TAS任务,我们将其定义为流式视频实时时间动作分割(SVTAS)任务。本文中,我们提出一种面向SVTAS任务的实时端到端多模态模型。更具体地,在无法获取任何未来信息的情况下,我们实时分割流式视频块的当前人体动作。此外,我们提出的模型将语言模型提取的上一个流式视频块特征与图像模型提取的当前图像特征相结合,以提升实时时间动作分割的质量。据我们所知,这是首个多模态实时时间动作分割模型。在与完整视频时间动作分割相同的评估标准下,我们的模型以低于最先进模型40%的计算量实时分割人体动作,并达到了完整视频最先进模型90%的精度。

关键词

引用

@article{arxiv.2209.13808,
  title  = {Streaming Video Temporal Action Segmentation In Real Time},
  author = {Wujun Wen and Yunheng Li and Zhuben Dong and Lin Feng and Wanxiao Yang and Shenlan Liu},
  journal= {arXiv preprint arXiv:2209.13808},
  year   = {2023}
}

备注

accepted by ISKE2023