中文

多视角图像编辑注意力特征的整合

计算机视觉与模式识别 2024-02-23 v1 图形学 机器学习

摘要

大规模文本到图像模型启用了广泛的图像编辑技术,利用文本提示甚至空间控制。然而,将这些编辑方法应用于描述单个场景的多视角图像会导致3D不一致的结果。本文聚焦于基于空间控制的几何操作,引入一种方法在各种视角之间整合编辑过程。我们基于两个见解:(1)在生成过程中保持一致的特征有助于实现多视角编辑的一致性,(2)自注意力层中的查询对图像结构具有显著影响。因此,我们提出通过强制查询的一致性来提高编辑图像的几何一致性。为此,我们引入QNeRF,这是一个基于编辑图像内部查询特征训练的神经辐射场。训练后,QNeRF可渲染3D一致的查询,这些查询随后被软注入到自注意力层中用于生成,从而大幅提高了多视角一致性。我们通过渐进式迭代方法细化该过程,以更好地整合各扩散时间步中的查询。我们将方法与多种现有技术进行比较,证明其能够实现更好的多视角一致性和更高的输入场景保真度。这些优势使我们能够使用更少的视觉瑕疵训练NeRF,且几何对齐更准确。

关键词

引用

@article{arxiv.2402.14792,
  title  = {Consolidating Attention Features for Multi-view Image Editing},
  author = {Or Patashnik and Rinon Gal and Daniel Cohen-Or and Jun-Yan Zhu and Fernando De la Torre},
  journal= {arXiv preprint arXiv:2402.14792},
  year   = {2024}
}

备注

Project Page at https://qnerf-consolidation.github.io/qnerf-consolidation/