通过跨模态注意力注入实现对齐的新视角图像与几何合成
计算机视觉与模式识别
2026-02-09 v3
摘要
我们提出了一种基于扩散的框架,通过变形与修复方法实现对齐的新视角图像与几何生成。与先前需要密集姿态图像或仅限于域内视图的姿态嵌入生成模型不同,我们的方法利用现成的几何预测器从参考图像预测部分几何,并将新视角合成表述为图像和几何的修复任务。为确保生成图像与几何之间的准确对齐,我们提出跨模态注意力蒸馏,即在训练和推理过程中将图像扩散分支的注意力图注入并行的几何扩散分支。这种多任务方法产生了协同效应,促进了几何鲁棒的图像合成以及定义明确的几何预测。我们进一步引入了基于邻近度的网格条件化,以整合深度和法线线索,在点云之间进行插值,并过滤错误预测的几何对生成过程的影响。实验结果表明,我们的方法在一系列未见场景中对图像和几何均实现了高保真外推视角合成,在插值设置下提供了具有竞争力的重建质量,并生成了几何对齐的彩色点云以实现全面的 3D 完成。项目页面位于 https://cvlab-kaist.github.io/MoAI。
引用
@article{arxiv.2506.11924,
title = {Aligned Novel View Image and Geometry Synthesis via Cross-modal Attention Instillation},
author = {Min-Seop Kwak and Junho Kim and Sangdoo Yun and Dongyoon Han and Taekyung Kim and Seungryong Kim and Jin-Hwa Kim},
journal= {arXiv preprint arXiv:2506.11924},
year = {2026}
}
备注
Project page at https://cvlab-kaist.github.io/MoAI