中文

SCT:用于集合监督动作分割的集合约束时序 Transformer

计算机视觉与模式识别 2020-04-01 v1

摘要

时序动作分割是一个日益受关注的课题,然而标注视频中的每一帧繁琐且昂贵。因此弱监督方法旨在从仅弱标注的视频中学习时序动作分割。在本工作中,我们假设每个训练视频仅给出视频中出现的动作列表,而不给出其发生时间、频率与顺序。为处理该任务,我们提出了一种可在此类数据上端到端训练的方法。该方法将视频划分为较小的时序区域,并预测每个区域的动作标签及其长度。此外,网络估计每一帧的动作标签。通过度量逐帧预测与时序区域及标注动作标签的一致性程度,网络学习将视频划分为类一致区域。我们在三个数据集上评估了该方法,其取得了最先进的(state-of-the-art)结果。

关键词

引用

@article{arxiv.2003.14266,
  title  = {SCT: Set Constrained Temporal Transformer for Set Supervised Action Segmentation},
  author = {Mohsen Fayyaz and Juergen Gall},
  journal= {arXiv preprint arXiv:2003.14266},
  year   = {2020}
}

备注

CVPR 2020