生成式视频模型能否帮助姿态估计?
计算机视觉与模式识别
2024-12-23 v1
摘要
来自图像且与之几乎没有重叠的两两姿态估计是计算机视觉中的一个开放挑战。即使是在大规模数据集上训练的现有方法,在这些场景下也难以应对,由于缺乏可识别的对应点或视觉重叠。受人类能够从多样化场景中推断空间关系的能力启发,我们提出一种新方法,InterPose,通过利用预训练生成式视频模型中编码的丰富先验知识。我们提议使用视频模型在两个输入图像之间 hallucinate 中间帧,有效地创建密集的视觉过渡,从而显著简化姿态估计的问题。由于当前的视频模型仍可能产生不合理的运动或几何不一致,我们引入一种自洫得分,用于评估从采样视频中得到的姿态预测的一致性。我们展示了该方法在三种最先进的视频模型上的泛化性,并在四个多样化数据集上(包括室内、户外和物体中心场景)相对于最先进的 DUSt3R 获得持续的改进。我们的发现表明,利用在大量视频数据上训练的大型生成模型来改进姿态估计模型是一个充满希望的途径,而这些视频数据比 3D 数据更易获得。详见我们的项目页面:https://inter-pose.github.io/。
引用
@article{arxiv.2412.16155,
title = {Can Generative Video Models Help Pose Estimation?},
author = {Ruojin Cai and Jason Y. Zhang and Philipp Henzler and Zhengqi Li and Noah Snavely and Ricardo Martin-Brualla},
journal= {arXiv preprint arXiv:2412.16155},
year = {2024}
}
备注
Project page: https://inter-pose.github.io/