CrossModalityDiffusion:基于统一中间表示的多模态新视角合成
计算机视觉与模式识别
2025-01-20 v1 人工智能
图像与视频处理
摘要
地理空间成像利用来自多种感知模态(如EO、SAR和LiDAR)的数据,从地面无人机到卫星视角不等,这些异构输入为场景理解提供了重要机遇,但在缺乏精确地面真实数据时,挑战在于准确解释几何结构。为此,我们提出CrossModalityDiffusion,一个旨在无需场景几何先验知识即可生成不同模态和视角图像的模块化框架。CrossModalityDiffusion采用模态特定编码器,接收多个输入图像并产生编码相对于输入相机位置的场景结构的几何感知特征体积。特征体积所在的空间作为统一输入模态的共同基地。这些特征体积被重叠并使用体积渲染技术从新视角渲染为特征图像。渲染后的特征图像用作特定模态扩散模型的条件输入,从而实现对所需输出模态的图像合成。本文表明,联合训练不同模块可确保框架内所有模态几何理解的一致性。我们在合成ShapeNet车辆数据集上验证了CrossModalityDiffusion的能力,展示了其在多种成像模态和视角下生成准确且一致的新视角的有效性。
引用
@article{arxiv.2501.09838,
title = {CrossModalityDiffusion: Multi-Modal Novel View Synthesis with Unified Intermediate Representation},
author = {Alex Berian and Daniel Brignac and JhihYang Wu and Natnael Daba and Abhijit Mahalanobis},
journal= {arXiv preprint arXiv:2501.09838},
year = {2025}
}
备注
Accepted in the 2025 WACV workshop GeoCV