BID:用于无监督时序动作局部化预训练的边界-内部解码
计算机视觉与模式识别
2024-03-13 v1
摘要
骨架基表示相对于图像在姿态局部化和理解方面具有对视角、光照和遮挡的鲁棒性,但在脱离上下文时常显得模糊且不完整,甚至连人类标注者也是如此。正如婴儿类比语言前先辨认手势一样,动作可以在贴标签前被概念化。因此,我们提出了首个无监督预训练框架——边界-内部解码(Boundary-Interior Decoding, BID),其将骨架动作序列划分为若干发现的语义上有意义的预动作片段。通过对预训练网络进行微调并使用少量标注数据,我们的结果显著优于当前最先进方法。
引用
@article{arxiv.2403.07354,
title = {BID: Boundary-Interior Decoding for Unsupervised Temporal Action Localization Pre-Trainin},
author = {Qihang Fang and Chengcheng Tang and Shugao Ma and Yanchao Yang},
journal= {arXiv preprint arXiv:2403.07354},
year = {2024}
}
备注
18 pages, 8 figures