中文

面向令牌化人体动力学表示

计算机视觉与模式识别 2021-11-23 v1

摘要

对于人体动作理解,一个流行的研究方向是分析具有明确语义内容的短视频片段,如跳跃和饮酒。然而,理解短语义动作的方法无法直接迁移到如舞蹈这样的长时人体动力学,其中甚至对人体运动进行语义标注也变得具有挑战性。同时,自然语言处理(NLP)社区已通过在大规模预训练上解决类似标注稀缺挑战取得进展,其通过单一模型改进了若干下游任务。在这项工作中,我们研究如何以自监督方式将视频分割并聚类为重复的时间模式,即动作发现(acton discovery),这是通往视频令牌化的主要障碍。我们提出一个两阶段框架,首先通过对比视频帧的两个增强视图(以其时间上下文为条件)获得帧级表示。随后跨视频集合的帧级表示由K-means聚类。然后通过从同一聚类内的帧形成连续运动序列来自动提取acton。我们通过Kendall's Tau评估帧级表示学习步骤,通过归一化互信息和语言熵评估词典构建步骤。我们还研究了此令牌化的三种应用:体裁分类、动作分割和动作组合。在AIST++和PKU-MMD数据集上,acton相较若干基线带来了显著的性能提升。

关键词

引用

@article{arxiv.2111.11433,
  title  = {Towards Tokenized Human Dynamics Representation},
  author = {Kenneth Li and Xiao Sun and Zhirong Wu and Fangyun Wei and Stephen Lin},
  journal= {arXiv preprint arXiv:2111.11433},
  year   = {2021}
}