中文

NVS-Adapter:基于单张图像的即插即用新视角合成

计算机视觉与模式识别 2024-08-13 v2

摘要

大规模文本到图像(T2I)模型的迁移学习近期在从单张图像合成多样化物体的新视角合成(NVS)方面展现出令人瞩目的潜力。以往的方法通常在多视角数据集上训练大模型以进行 NVS,然而微调 T2I 模型的全部参数不仅成本高昂,还会削弱 T2I 模型在新领域生成多样化图像的泛化能力。本研究提出了一种有效的方法,称为 NVS-Adapter,作为 T2I 模型的即插即用模块,在充分利用 T2I 模型泛化能力的同时,合成视觉物体的新颖多视角。NVS-Adapter 包含两个主要组件:视角一致性交叉注意力(view-consistency cross-attention)通过学习视觉对应关系来对齐视角特征的局部细节;全局语义条件化(global semantic conditioning)则将生成视角的语义结构与参考视角对齐。实验结果表明,NVS-Adapter 能够有效合成几何一致的多视角,并且在无需对 T2I 模型进行全量微调的情况下于基准测试中取得高性能。代码和数据公开于 ~\href{https://postech-cvlab.github.io/nvsadapter/}{https://postech-cvlab.github.io/nvsadapter/}。

关键词

引用

@article{arxiv.2312.07315,
  title  = {NVS-Adapter: Plug-and-Play Novel View Synthesis from a Single Image},
  author = {Yoonwoo Jeong and Jinwoo Lee and Chiheon Kim and Minsu Cho and Doyup Lee},
  journal= {arXiv preprint arXiv:2312.07315},
  year   = {2024}
}

备注

[ECCV2024] Project Page: https://postech-cvlab.github.io/nvsadapter/