GeoMan:使用图像到视频扩散的时间一致人体几何估计
计算机视觉与模式识别
2025-05-30 v1 人工智能
图像与视频处理
摘要
从视频中估计准确且时间一致的 3D 人体几何是计算机视觉中的一个挑战性问题。现有方法主要针对单图像进行优化,通常存在时间不一致性,且无法捕捉细粒度的动态细节。为了解决这些局限性,我们提出了 GeoMan,一种旨在从单目人体视频中产生准确且时间一致的深度和法线估计的新架构。GeoMan 解决了两个关键挑战:高质量 4D 训练数据的稀缺性,以及准确建模人体尺寸所需的度量深度估计。为了克服第一个挑战,GeoMan 采用基于图像的模型来估计视频第一帧的深度和法线,然后以此作为视频扩散模型的条件,将视频几何估计任务重新构建为图像到视频生成问题。这种设计将几何估计的繁重工作交由图像模型处理,并简化了视频模型的角色,使其专注于复杂细节,同时利用从大规模视频数据集中学习到的先验。因此,GeoMan 提高了时间一致性和泛化能力,同时仅需最少的 4D 训练数据。为了解决准确人体尺寸估计的挑战,我们引入了一种根相对深度表示,它保留了关键的人体尺度细节,且更容易从单目输入中进行估计,克服了传统仿射不变和度量深度表示的局限性。GeoMan 在定性和定量评估中均取得了 SOTA 性能,证明了其在克服视频中 3D 人体几何估计长期存在的挑战方面的有效性。
引用
@article{arxiv.2505.23085,
title = {GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion},
author = {Gwanghyun Kim and Xueting Li and Ye Yuan and Koki Nagano and Tianye Li and Jan Kautz and Se Young Chun and Umar Iqbal},
journal= {arXiv preprint arXiv:2505.23085},
year = {2025}
}
备注
Project page: https://research.nvidia.com/labs/dair/geoman