中文

通过设备端视频流学习实现弱监督时序动作定位

计算机视觉与模式识别 2022-08-29 v1 机器学习

摘要

动作检测在视频中已被广泛应用于设备端应用。实际设备端视频通常为未修剪的长视频,同时包含动作与背景。模型最好既能识别动作类别,又能定位动作发生的时间位置。此任务称为时序动作定位(TAL),通常在云端以收集并标注的多个未修剪视频进行训练。期望TAL模型能从新数据持续本地学习,从而直接提升动作检测精度并保护用户隐私。然而训练TAL模型并非易事,因其需要大量带时序标注的视频样本。而逐帧标注视频极其耗时且昂贵。尽管已有弱监督TAL(W-TAL)利用仅含视频级标签的未修剪视频进行学习,该方法也不适用于设备端学习场景。在实际设备端学习中,数据以流形式采集。将长视频流划分为多段需大量人力,阻碍了TAL任务在真实设备端学习中的应用。为使W-TAL模型能从长而未修剪的流式视频学习,我们提出一种可直适应新环境的高效视频学习方法。我们首先提出基于对比得分的自适应视频划分与片段合并方法,将视频流转为多段。随后,我们探索TAL任务上不同采样策略以尽量少请求标注。据我们所知,我们首次尝试直接从设备端长视频流学习。

关键词

引用

@article{arxiv.2208.12673,
  title  = {Enabling Weakly-Supervised Temporal Action Localization from On-Device Learning of the Video Stream},
  author = {Yue Tang and Yawen Wu and Peipei Zhou and Jingtong Hu},
  journal= {arXiv preprint arXiv:2208.12673},
  year   = {2022}
}

备注

Manuscript received April 07, 2022; revised June 11, 2022; accepted July 05, 2022. This article was presented in the International Conference on 2022 and appears as part of the ESWEEK-TCAD special issue