中文

跨视角融合扩散:几何与文本导向下的空中图像合成

计算机视觉与模式识别 2024-08-22 v2

摘要

空中图像分析是许多研究领域的关键任务。然而,由于其高昂的 effort 与成本,获取高质量空中图像并非总是容易实现。一种解决方案是使用 Ground-to-Aerial(G2A)技术从易于收集的地面图像合成空中图像。然而,由于涉及剧烈的视角变化、遮挡以及视野范围等挑战,G2A 鲜有被研究。本文提出了一种 novel 的几何保真 Ground-to-Aerial (GPG2A)图像合成模型,可生成真实的空中图像。GPG2A包含两个阶段:第一个阶段从地面图像预测鸟瞰图(BEV)分割(称为 BEV 布局图),第二个阶段则根据预测的 BEV 布局图和地面图像的文本描述合成空中图像。为训练本模型,我们提出了新的多模态跨视角数据集,即 VIGORv2,其基于 VIGOR 构建,新增了空中图像、地图和文本描述。我们的大量实验表明,GPG2A合成的几何保真空中图像优于现有模型。我们还展示了两个应用:跨视角地理位置定位的数据增强和基于草图的区域搜索,以进一步验证 GPG2A 的有效性。代码和数据将公开提供。

关键词

引用

@article{arxiv.2408.04224,
  title  = {Cross-View Meets Diffusion: Aerial Image Synthesis with Geometry and Text Guidance},
  author = {Ahmad Arrabi and Xiaohan Zhang and Waqas Sultani and Chen Chen and Safwan Wshah},
  journal= {arXiv preprint arXiv:2408.04224},
  year   = {2024}
}