基于视觉转换器的人体网格恢复视频推断
计算机视觉与模式识别
2025-07-15 v1
摘要
从图像进行人体网格恢复(Human Mesh Recovery, HMR)是一项具有挑战性的任务,由于其内在的歧义性。现有HMR方法要么利用时间信息,要么利用运动学关系以获得更高的精度,但目前尚无方法同时利用两者。因此,我们提出了一种新方法——“基于视觉转换器的人体网格恢复视频推断”(HMR-ViT),旨在综合考虑时间信息和运动学信息。在HMR-ViT中,首先通过图像编码器从视频帧获取的特征向量构建时空运动学特征图。构建特征图时,我们采用通道重排矩阵(Channel Rearranging Matrix, CRM),使相似的运动学特征在空间上相邻。随后,该特征图再经过视觉转换器编码,最终通过回归网络推断SMPL姿态和形状参数。对3DPW和Human3.6M数据集进行大规模评估表明,我们的方法在HMR任务中达到了具竞争力的性能。
引用
@article{arxiv.2507.08981,
title = {Video Inference for Human Mesh Recovery with Vision Transformer},
author = {Hanbyel Cho and Jaesung Ahn and Yooshin Cho and Junmo Kim},
journal= {arXiv preprint arXiv:2507.08981},
year = {2025}
}
备注
Accepted to IEEE FG 2023