中文

BID:用于无监督时序动作局部化预训练的边界-内部解码

计算机视觉与模式识别 2024-03-13 v1

摘要

骨架基表示相对于图像在姿态局部化和理解方面具有对视角、光照和遮挡的鲁棒性,但在脱离上下文时常显得模糊且不完整,甚至连人类标注者也是如此。正如婴儿类比语言前先辨认手势一样,动作可以在贴标签前被概念化。因此,我们提出了首个无监督预训练框架——边界-内部解码(Boundary-Interior Decoding, BID),其将骨架动作序列划分为若干发现的语义上有意义的预动作片段。通过对预训练网络进行微调并使用少量标注数据,我们的结果显著优于当前最先进方法。

关键词

引用

@article{arxiv.2403.07354,
  title  = {BID: Boundary-Interior Decoding for Unsupervised Temporal Action Localization Pre-Trainin},
  author = {Qihang Fang and Chengcheng Tang and Shugao Ma and Yanchao Yang},
  journal= {arXiv preprint arXiv:2403.07354},
  year   = {2024}
}

备注

18 pages, 8 figures