中文

3D Congealing:自然场景下的 3D 感知图像对齐

计算机视觉与模式识别 2024-04-03 v1

摘要

我们提出了 3D Congealing,一个针对捕获语义相似物体的 2D 图像进行 3D 感知对齐的新问题。给定一组无标签的互联网图像,我们的目标是将输入中的共享语义部分关联起来,并将 2D 图像中的知识聚合到一个共享的 3D 规范空间中。我们引入了一个通用框架来解决该任务,且不假设形状模板、姿态或任何相机参数。其核心是一个封装了几何和语义信息的规范 3D 表示。该框架联合优化规范表示、每个输入图像的姿态以及将 2D 像素坐标映射到 3D 规范坐标系以实现形状匹配的每图像坐标图。优化过程融合了来自预训练图像生成模型的先验知识和来自输入图像的语义信息。前者为这一欠约束任务提供了强有力的知识指导,而后者提供了必要的信息以缓解预训练模型的训练数据偏差。我们的框架可用于各种任务,如对应匹配、姿态估计和图像编辑,在具有挑战性光照条件下的真实世界图像数据集和自然场景在线图像集合上均取得了优异的结果。

关键词

引用

@article{arxiv.2404.02125,
  title  = {3D Congealing: 3D-Aware Image Alignment in the Wild},
  author = {Yunzhi Zhang and Zizhang Li and Amit Raj and Andreas Engelhardt and Yuanzhen Li and Tingbo Hou and Jiajun Wu and Varun Jampani},
  journal= {arXiv preprint arXiv:2404.02125},
  year   = {2024}
}

备注

Project page: https://ai.stanford.edu/~yzzhang/projects/3d-congealing/