中文

SSCAP:用于无监督时序动作分割的自监督共现动作解析

计算机视觉与模式识别 2021-10-26 v3

摘要

时序动作分割是一项为视频中每一帧标注动作标签的任务。然而,在大量视频语料上逐帧标注以构建全面的监督训练数据集代价极高。因此,本工作提出一种无监督方法,即 SSCAP,其在无标签视频语料上运行并预测跨视频的一组可能时序片段。SSCAP 利用自监督学习提取可区分特征,随后应用一种新型共现动作解析算法,不仅捕捉活动结构下子动作间的相关性,还以准确且通用的方式估计子动作的时序路径。我们在经典数据集(Breakfast、50Salads)以及具有更复杂活动结构与相似子动作的新兴细粒度动作数据集(FineGym)上进行评估。结果表明,SSCAP 在所有数据集上均达到最先进性能,甚至可超越部分弱监督方法,证明了其有效性与泛化能力。

关键词

引用

@article{arxiv.2105.14158,
  title  = {SSCAP: Self-supervised Co-occurrence Action Parsing for Unsupervised Temporal Action Segmentation},
  author = {Zhe Wang and Hao Chen and Xinyu Li and Chunhui Liu and Yuanjun Xiong and Joseph Tighe and Charless Fowlkes},
  journal= {arXiv preprint arXiv:2105.14158},
  year   = {2021}
}

备注

WACV 2022 camera ready