ViA:基于运动重定向的视角不变骨架动作表征学习
计算机视觉与模式识别
2022-09-02 v1
摘要
当前用于骨架动作表征学习的自监督方法常聚焦于受限场景,即视频与骨架数据在实验室环境中录制。在处理真实世界视频中估计得到的骨架数据时,由于不同主体与相机视角间的巨大差异,此类方法表现不佳。为解决该问题,我们提出 ViA,一种用于自监督骨架动作表征学习的新型视角不变自编码器。ViA 利用不同人体执行者之间的运动重定向作为前置任务,以在 2D 或 3D 骨架序列的视觉表征之上解耦出潜在动作特定的“运动”特征。此类“运动”特征对骨架几何与相机视角均具有不变性,并使 ViA 能够同时促进跨主体与跨视角的动作分类任务。我们开展了聚焦于基于骨架动作识别的迁移学习研究,并在真实世界数据(如 Kinetics)上进行自监督预训练。我们的结果表明,ViA 学习到的骨架表征具有足够的通用性,不仅在 NTU-RGB+D 60 与 NTU-RGB+D 120 等 3D 实验室数据集上,也在仅能准确估计 2D 数据的真实世界数据集(如 Toyota Smarthome、UAV-Human 与 Penn Action)上,均优于当前最优的动作分类精度。
引用
@article{arxiv.2209.00065,
title = {ViA: View-invariant Skeleton Action Representation Learning via Motion Retargeting},
author = {Di Yang and Yaohui Wang and Antitza Dantcheva and Lorenzo Garattoni and Gianpiero Francesca and Francois Bremond},
journal= {arXiv preprint arXiv:2209.00065},
year = {2022}
}
备注
project website: https://walker-a11y.github.io/ViA-project