中文

MVInpainter:学习多视图一致修复以桥接 2D 与 3D 编辑

计算机视觉与模式识别 2024-11-20 v3

摘要

新视图合成(NVS)和 3D 生成最近取得了显著进展。然而,这些工作主要聚焦于受限类别或合成 3D 资产,这阻碍了其向具有挑战性的真实场景泛化,并且无法与 2D 合成直接结合使用。此外,这些方法严重依赖相机姿态,限制了其实际应用。为克服这些问题,我们提出了 MVInpainter,将 3D 编辑重新表述为多视图 2D 修复任务。具体而言,MVInpainter 并非从头生成全新的视图,而是利用参考引导对多视图图像进行部分修复,这大大简化了真实场景中 NVS 的难度,并利用未掩码线索而非显式姿态条件。为确保跨视图一致性,MVInpainter 通过运动分量的视频先验和拼接参考键值注意力的外观引导得到增强。此外,MVInpainter 引入槽注意力来聚合未掩码区域的高级光流特征,以控制相机运动,实现无姿态训练和推理。充分的场景级实验在目标中心和前向视角数据集上验证了 MVInpainter 的有效性,包括多视图目标移除、合成、插入和替换等多样化任务。项目页面为 https://ewrfcas.github.io/MVInpainter/。

关键词

引用

@article{arxiv.2408.08000,
  title  = {MVInpainter: Learning Multi-View Consistent Inpainting to Bridge 2D and 3D Editing},
  author = {Chenjie Cao and Chaohui Yu and Fan Wang and Xiangyang Xue and Yanwei Fu},
  journal= {arXiv preprint arXiv:2408.08000},
  year   = {2024}
}

备注

Project page: https://ewrfcas.github.io/MVInpainter/. Accepted at NeurIPS2024