BKinD-3D:从多视角视频中进行自监督三维关键点发现
计算机视觉与模式识别
2023-06-05 v3 人工智能
摘要
在三维中量化运动对于研究人类和其他动物的行为十分重要,但手动姿态标注获取成本高且耗时。自监督关键点发现是一种无需标注即可估计三维姿态的有前景策略。然而,当前的关键点发现方法通常处理单一 2D 视角,且不在 3D 空间中运行。我们提出一种新方法,从行为主体的多视角视频中在 3D 下进行自监督关键点发现,无需 2D 或 3D 中的任何关键点或边界框监督。我们的方法 BKinD-3D 使用带有 3D 体素热图的编码器-解码器架构,训练用于重建多视角间的时空差异,以及对学习到的主体 3D 骨骼的关节长度约束。通过这种方式,我们在人类和大鼠视频中发现关键点而无需手动监督,展示了 3D 关键点发现用于行为研究的潜力。
引用
@article{arxiv.2212.07401,
title = {BKinD-3D: Self-Supervised 3D Keypoint Discovery from Multi-View Videos},
author = {Jennifer J. Sun and Lili Karashchuk and Amil Dravid and Serim Ryou and Sonia Fereidooni and John Tuthill and Aggelos Katsaggelos and Bingni W. Brunton and Georgia Gkioxari and Ann Kennedy and Yisong Yue and Pietro Perona},
journal= {arXiv preprint arXiv:2212.07401},
year = {2023}
}
备注
CVPR 2023. Project page: https://sites.google.com/view/b-kind/3d Code: https://github.com/neuroethology/BKinD-3D