中文

基于增强时空上下文从单目视频进行时间一致鲁棒三维人体运动恢复

计算机视觉与模式识别 2023-11-21 v1

摘要

从单目视频中恢复时间一致的三维人体姿态、形状与运动是一项具有挑战性的任务,原因在于(自)遮挡、光照条件差、复杂的关节式身体姿态、深度模糊以及标注数据有限。此外,简单的逐帧估计是不够的,因其会导致抖动且不真实的结果。本文中,我们提出一种从单目视频进行时间一致运动估计的新方法。我们的方法不使用通用的类ResNet特征,而是使用身体感知特征表示与在时间窗上的独立逐帧姿态及相机初始化,随后通过对身体感知特征与逐帧初始化使用自相似性与自注意力的组合来进行新颖的时空特征聚合。它们共同通过考虑剩余的过去与未来帧为每一帧产生增强的时空上下文。这些特征用于预测人体模型的姿态与形状参数,并进一步使用LSTM精炼。在公开可用基准数据上的实验结果表明,我们的方法获得了显著更低的加速度误差,并在所有关键定量评估指标上优于现有的最先进方法,包括部分遮挡、复杂姿态甚至相对低照度等复杂场景。

关键词

引用

@article{arxiv.2311.11662,
  title  = {Enhanced Spatio-Temporal Context for Temporally Consistent Robust 3D Human Motion Recovery from Monocular Videos},
  author = {Sushovan Chanda and Amogh Tiwari and Lokender Tiwari and Brojeshwar Bhowmick and Avinash Sharma and Hrishav Barua},
  journal= {arXiv preprint arXiv:2311.11662},
  year   = {2023}
}