基于深度引导解码器的像素对齐多视角生成
计算机视觉与模式识别
2024-08-27 v1 人工智能
摘要
图像到多视角生成指的是从单个图像生成新视角的任务。最近的方法通过将文本到图像潜在扩散模型扩展为多视角版本,包含一个VAE图像编码器和U-Net扩散模型。具体而言,这些生成方法通常固定VAE仅微调U-Net。然而,输入图像计算的潜在向量显著下降且独立解码,导致多个视角之间出现显著的像素级错位。为解决此问题,我们提出了一种用于像素级图像到多视角生成的方法。与先前工作不同,我们在潜在视频扩散模型的VAE解码器中跨多个视角图像引入注意力层。具体地,我们引入深度截断的光束注意力,使模型能够在保持内存效率的同时关注空间相邻区域。由于在推理时很难获得真实深度且预训练的深度估计模型难以提供准确深度,因此为增强对不准确深度的泛化性,在训练时扰动深度输入。在推理时,我们采用快速的多视角到3D重建方法NeuS获取深度截断注意力的粗糙深度。我们的模型实现了多个视角图像间的更好像素对齐。此外,我们展示了该方法在改善下游多视角到3D重建任务方面的有效性。
引用
@article{arxiv.2408.14016,
title = {Pixel-Aligned Multi-View Generation with Depth Guided Decoder},
author = {Zhenggang Tang and Peiye Zhuang and Chaoyang Wang and Aliaksandr Siarohin and Yash Kant and Alexander Schwing and Sergey Tulyakov and Hsin-Ying Lee},
journal= {arXiv preprint arXiv:2408.14016},
year = {2024}
}