中文

C3Po:基于点图预测的跨视图跨模态对应

计算机视觉与模式识别 2026-01-13 v2

摘要

几何模型如 DUSt3R 在理解来自成对照片的场景几何方面取得了很大进展。然而,当输入来自截然不同的视角(例如航拍 vs. 地面)或模态(例如照片 vs. 抽象绘图)时,由于训练时观察到的情形不同,这些模型会失败。本文解决了一个更具挑战性的问题:在地面照片和平面图之间预测对应关系。当前用于联合照片-平面图推理的数据集要么在不同模态方面有限(VIGOR),要么在对应关系方面有限(WAFFLE)。为此,我们引入了新的数据集 C3,首先通过从互联网照片集合重建多个场景的 3D 结构,然后手动将重建与从互联网收集的平面图注册,进而可推导出图像与平面图之间的对应关系。C3 包含 90K 对平面图和照片,覆盖 597 个场景,包含 1530 万像素级对应关系和 85K 个相机位姿。我们发现,最先进的对应模型在该任务上表现不佳。通过在我们新的数据集上训练,我们可以将最佳-performing 方法的 RMSE 提升 34%。我们还利用预测的对应关系来估计相机位姿,并使用召回率指标评估性能。最后,我们确定了跨模态几何推理中的开放挑战,这些挑战正是我们的数据集旨在帮助解决的。

关键词

引用

@article{arxiv.2511.18559,
  title  = {C3Po: Cross-View Cross-Modality Correspondence by Pointmap Prediction},
  author = {Kuan Wei Huang and Brandon Li and Bharath Hariharan and Noah Snavely},
  journal= {arXiv preprint arXiv:2511.18559},
  year   = {2026}
}

备注

NeurIPS 2025