STRIDE:基于单视频的时间连续抗遮挡三维姿态估计
摘要
准确估计三维人体姿态对于动作识别、步态识别和虚拟/增强现实等多个领域至关重要。然而,该领域一个持久且重大的挑战是在严重遮挡条件下准确预测人体姿态。传统的基于图像的估计器由于缺乏时间上下文,难以处理严重遮挡,导致预测不一致。虽然基于视频的模型受益于处理时间数据,但在面对跨越多个帧的长时间遮挡时仍会遇到局限性。这一挑战源于这些模型难以泛化到训练数据集之外,且训练数据难以捕捉各种遮挡情况。针对这些挑战,我们提出了 STRIDE(Single-video based TempoRally contInuous Occlusion-Robust 3D Pose Estimation,基于单视频的时间连续抗遮挡三维姿态估计),这是一种新颖的测试时训练(Test-Time Training, TTT)方法,旨在为每个视频拟合人体运动先验。该方法专门处理模型训练期间未遇到的遮挡情况。通过采用 STRIDE,我们可以在测试时将一系列嘈杂的初始姿态估计细化为准确且时间连贯的姿态,有效克服了先前方法的局限性。我们的框架展示了灵活性,具有模型无关性,允许我们使用任何现成的三维姿态估计方法来提高鲁棒性和时间一致性。我们在 Occluded Human3.6M、Human3.6M 和 OCMotion 等具有挑战性的数据集上进行了全面的实验,验证了 STRIDE 的有效性。实验结果表明,STRIDE 不仅优于现有的基于单图像和基于视频的姿态估计模型,而且在处理重大遮挡方面表现出色,实现了快速、鲁棒、准确且时间一致的三维姿态估计。代码已公开在 https://github.com/take2rohit/stride。
引用
@article{arxiv.2312.16221,
title = {STRIDE: Single-video based Temporally Continuous Occlusion-Robust 3D Pose Estimation},
author = {Rohit Lal and Saketh Bachu and Yash Garg and Arindam Dutta and Calvin-Khang Ta and Dripta S. Raychaudhuri and Hannah Dela Cruz and M. Salman Asif and Amit K. Roy-Chowdhury},
journal= {arXiv preprint arXiv:2312.16221},
year = {2024}
}
备注
Paper accepted at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)-2025