中文

PoseCrafter:基于混合视频合成的极端姿态估计

计算机视觉与模式识别 2025-10-23 v1

摘要

从稀疏重叠图像对进行两两相机姿态估计仍是3D视觉中的关键且未解决的挑战。大多数现有方法在图像对重叠度小或无重叠时表现不佳。最近的研究方法通过视频插值合成中间帧并通过自一致性得分选择关键帧以应对此问题。然而,生成的帧常因重叠输入不足而出现模糊,且选择策略缓慢且未明确与姿态估计对齐。为解决此问题,我们提出混合视频生成(HVG),通过将视频插值模型与姿态条件的新视角合成模型耦合,以合成更清晰的中间帧;同时,我们提出基于特征对应关系的特征匹配选择器(FMS),从合成结果中选择适合姿态估计的中间帧。在剑桥地标、ScanNet、DL3DV-10K和NAVI等数据集上进行大量实验表明,与现有SOTA方法相比,PoseCrafter在重叠度小或无重叠的情况下显著提升了姿态估计性能。

关键词

引用

@article{arxiv.2510.19527,
  title  = {PoseCrafter: Extreme Pose Estimation with Hybrid Video Synthesis},
  author = {Qing Mao and Tianxin Huang and Yu Zhu and Jinqiu Sun and Yanning Zhang and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2510.19527},
  year   = {2025}
}

备注

39th Conference on Neural Information Processing Systems (NeurIPS 2025)