STAF:基于时空对齐融合的视频三维人体网格恢复
计算机视觉与模式识别
2024-01-04 v1
摘要
近年来,从单目图像恢复三维人体网格取得了显著进展。然而,现有模型通常忽略空间和时间信息,这可能导致网格与图像错位以及时间上的不连续性。为此,我们提出了一种新颖的时空对齐融合(STAF)模型。作为一个基于视频的模型,它通过基于注意力的时序一致性融合模块(TCFM)利用人体运动中的连贯性线索。至于空间网格对齐证据,我们通过预测的网格投影在特征图上提取细粒度局部信息。基于这些空间特征,我们进一步引入了一个多阶段相邻空间对齐融合模块(SAFM),以增强目标帧的特征表示。除上述之外,我们还提出了一个平均池化模块(APM),使模型能够关注整个输入序列,而不仅仅是目标帧。该方法能显著提高视频恢复结果的平滑性。在3DPW、MPII3D和H36M数据集上的大量实验证明了STAF的优越性。我们在精度和平滑性之间实现了最先进的权衡。我们的代码和更多视频结果见项目页面https://yw0208.github.io/staf/。
引用
@article{arxiv.2401.01730,
title = {STAF: 3D Human Mesh Recovery from Video with Spatio-Temporal Alignment Fusion},
author = {Wei Yao and Hongwen Zhang and Yunlian Sun and Jinhui Tang},
journal= {arXiv preprint arXiv:2401.01730},
year = {2024}
}
备注
Project Page: https://yw0208.github.io/staf/