中文

我在哪里,我将看到什么:用于空间定位与视角预测的自回归模型

计算机视觉与模式识别 2024-10-25 v1

摘要

空间智能是机器在三维空间和时间中感知、推理和行动的能力。大规模自回归模型的最新进展已在各种推理任务中展现出卓越的能力。然而,这些模型在空间推理的基本方面常常遇到困难,特别是在回答“我在哪里?”和“我将看到什么?”这类问题时。尽管已有一些尝试,但现有方法通常将它们视为独立的任务,未能捕捉其相互关联的本质。在本文中,我们提出了生成式空间变换器,一种新颖的自回归框架,它联合处理空间定位和视角预测。我们的模型同时从单张图像估计相机姿态,并从新的相机姿态预测视图,有效地弥合了空间感知与视觉预测之间的鸿沟。所提出的创新性相机令牌化方法使模型能够以自回归方式学习二维投影及其对应空间视角的联合分布。这种统一的训练范式表明,姿态估计和新视角合成的联合优化首次在两项任务中都带来了性能提升,突显了空间感知与视觉预测之间的内在关系。

关键词

引用

@article{arxiv.2410.18962,
  title  = {Where Am I and What Will I See: An Auto-Regressive Model for Spatial Localization and View Prediction},
  author = {Junyi Chen and Di Huang and Weicai Ye and Wanli Ouyang and Tong He},
  journal= {arXiv preprint arXiv:2410.18962},
  year   = {2024}
}