基于交叉注意力引导的多视图无监督图像生成
计算机视觉与模式识别
2023-12-08 v1
摘要
由神经辐射场(NeRF)模型驱动的新视图合成兴趣日益增长,但由于其依赖精确标注的多视图图像而受到可扩展性问题的阻碍。最近的模型通过在合成多视图数据上微调大型文本到图像扩散模型来解决这个问题。尽管具有鲁棒的零样本泛化能力,但由于合成-真实域差距,它们可能需要后处理,并可能面临质量问题。本文介绍了一种新颖的流水线,用于在单类别数据集上无监督训练姿态条件扩散模型。借助预训练的自监督视觉Transformer(DINOv2),我们通过比较特定对象部分的可见性和位置来聚类数据集,从而识别对象姿态。在姿态标签上训练的姿态条件扩散模型,在推理时配备跨帧注意力,确保了跨视图一致性,而我们的新颖硬注意力引导进一步增强了这一点。我们的模型MIRAGE在真实图像的新视图合成方面超越了先前的工作。此外,MIRAGE对多样化的纹理和几何形状具有鲁棒性,正如我们在使用预训练的Stable Diffusion生成的合成图像上的实验所证明的那样。
引用
@article{arxiv.2312.04337,
title = {Multi-View Unsupervised Image Generation with Cross Attention Guidance},
author = {Llukman Cerkezi and Aram Davtyan and Sepehr Sameni and Paolo Favaro},
journal= {arXiv preprint arXiv:2312.04337},
year = {2023}
}