STEP:动物与人类的同步追踪与姿态估计
计算机视觉与模式识别
2025-03-21 v2
摘要
我们引入了STEP,这是一个利用基于Transformer的判别模型预测的新框架,用于跨不同动物物种和人类进行同步追踪与姿态估计。我们的灵感来自于这样一个事实:尽管大脑区域专门用于形状和运动处理,但人脑仍能利用时空连续性并执行并发定位和姿态估计。传统的判别模型通常需要预定义的目标状态来确定模型权重,我们通过高斯图软预测(GMSP)和偏移图回归适配器(OMRA)模块解决了这一挑战。这些模块消除了将关键点目标状态作为输入的必要性,从而简化了流程。我们的方法从给定视频序列初始帧中的已知目标状态开始。随后,它无缝地追踪目标并估计具有解剖学重要性的关键点,作为后续帧的输出。与流行的自顶向下姿态估计方法不同,由于具备追踪能力,我们的方法不依赖于逐帧的目标检测。这促进了推理效率和潜在应用的重大进步。我们在包含不同物种的数据集上训练并验证了我们的方法。我们的实验展示了优于现有方法的结果,为包括但不限于动作识别和行为分析在内的各种应用打开了大门。
引用
@article{arxiv.2503.13344,
title = {STEP: Simultaneous Tracking and Estimation of Pose for Animals and Humans},
author = {Shashikant Verma and Harish Katti and Soumyaratna Debnath and Yamuna Swamy and Shanmuganathan Raman},
journal= {arXiv preprint arXiv:2503.13344},
year = {2025}
}