行为视频中的自监督关键点发现
计算机视觉与模式识别
2022-04-28 v2
摘要
我们提出了一种从未标注行为视频中学习智能体姿态与结构的方法。从行为视频中行为主体通常是运动主要来源这一观察出发,我们的方法——行为关键点发现(B-KinD)——采用带几何瓶颈的编码器-解码器架构来重建视频帧间的时空差异。通过仅关注运动区域,我们的方法直接在输入视频上工作,无需人工标注。在多种智能体类型(小鼠、果蝇、人、水母和树木)上的实验证明了我们方法的通用性,并揭示我们发现的关键点代表了具有语义意义的身体部位,在自监督方法的关键点回归上达到了最先进(SOTA)性能。此外,B-KinD在下游任务(如行为分类)上取得了与有监督关键点相当的性能,表明我们的方法相比有监督方法可大幅降低模型训练成本。
引用
@article{arxiv.2112.05121,
title = {Self-Supervised Keypoint Discovery in Behavioral Videos},
author = {Jennifer J. Sun and Serim Ryou and Roni Goldshmid and Brandon Weissbourd and John Dabiri and David J. Anderson and Ann Kennedy and Yisong Yue and Pietro Perona},
journal= {arXiv preprint arXiv:2112.05121},
year = {2022}
}
备注
CVPR 2022. Code: https://github.com/neuroethology/BKinD Project page: https://sites.google.com/view/b-kind