中文

基于逐帧离散特征的自监督人体运动结构提取

计算机视觉与模式识别 2023-09-13 v1 机器人学

摘要

本文提出一种编码器-解码器模型,以自监督方式提取由逐帧离散特征表示的人体运动结构。在所提方法中,特征作为运动码本中的码字被提取,无需使用人类知识,且这些码字之间的关系可在图上可视化。由于码字相比捕获帧率预期在时间上稀疏且可被多个序列共享,所提网络模型也满足了训练约束的需求。具体而言,该模型由自注意力层与向量聚类块组成。注意力层有助于发现稀疏关键帧与作为运动码字的离散特征,随后通过向量聚类提取。约束实现为训练损失,使得相同运动码字尽可能连续且可被多个序列共享。此外,我们提出使用因果自注意力作为一种对由大量帧组成的长序列计算注意力的方法。在我们的实验中,运动码字的稀疏结构被用于构建图谱,以可视化码字间关系及序列间差异。随后我们将提取的运动码字应用于多个识别任务以评估其有效性,发现通过线性探测可达到与任务优化方法相当的性能水平。

关键词

引用

@article{arxiv.2309.05972,
  title  = {Self-supervised Extraction of Human Motion Structures via Frame-wise Discrete Features},
  author = {Tetsuya Abe and Ryusuke Sagawa and Ko Ayusawa and Wataru Takano},
  journal= {arXiv preprint arXiv:2309.05972},
  year   = {2023}
}