中文

FactorizedHMR:一种用于视频人体网格恢复的混合框架

计算机视觉与模式识别 2026-05-19 v2 人工智能

摘要

人体网格恢复(HMR)本质上具有模糊性:在遮挡或微弱深度线索下,多个 3D 身体可以解释同一图像证据。这种模糊性在全身各处并非均匀分布,因为躯干姿态和根结构通常受到相对良好的约束,而四肢等远端关节则更具不确定性。基于这一观察,我们提出了 FactorizedHMR,一种对这两种情况区别对待的两阶段框架。确定性回归模块首先恢复稳定的躯干-根部锚点,概率流匹配模块随后补全剩余的非躯干关节。为使该补全可靠,我们将复合目标表示与几何感知监督及特征感知无分类器引导相结合,在保留躯干-根部锚点的同时,改进了对易模糊关节的单参考恢复。我们还引入了一条合成数据流水线,在多样化视点下提供配对的图像-相机-运动监督。在相机空间和世界空间基准测试中,FactorizedHMR 保持了与强基线相当的竞争力,在重度遮挡恢复和对漂移敏感的世界空间指标上取得了最显著的提升。

关键词

引用

@article{arxiv.2605.14854,
  title  = {FactorizedHMR: A Hybrid Framework for Video Human Mesh Recovery},
  author = {Patrick Kwon and Chen Chen},
  journal= {arXiv preprint arXiv:2605.14854},
  year   = {2026}
}