基于多尺度语义先验特征的城市街景图像深度神经网络
计算机视觉与模式识别
2024-09-20 v2
摘要
街景图像已被广泛应用于关键移动制图数据源。街景图像的填充是街景图像处理的关键步骤,既用于隐私保护,也用于城市环境映射应用。本文提出了一种新型深度神经网络 (DNN),称为多尺度语义先验特征引导街景图像填充网络 (MFN),用于填充街景图像,生成不包含移动物体(如行人、车辆)的静态街景图像。为增强全局上下文理解,引入语义先验提示器,从大型预训练模型中学习丰富的语义先验。我们通过堆叠多个语义金字塔聚合 (SPA) 模块设计提示器,捕获广泛的视觉特征模式。提出一种带解码器的语义增强图像生成器,包含每个尺度级别上的新型级联 Learnable Prior Transferring (LPT) 模块。对于每个解码器块,应用注意力传递机制以捕获长期依赖,并将语义先验特征与图像特征融合,以自适应方式恢复合理的结构。此外,采用背景感知的数据处理方案,以防止孔洞中生成幻觉物体。在 Apolloscapes 和 Cityscapes 数据集上的实验表明,与最先进的方法相比,本方法在 MAE 和 LPIPS 上分别提高了约 9.5% 和 41.07%。还对多组人员进行了视觉比较调查,以提供性能评估,结果表明所提出的 MFN 为隐私保护和生成更可靠的城市街景场景提供了有前景的解决方案。
引用
@article{arxiv.2405.10504,
title = {Multi-scale Semantic Prior Features Guided Deep Neural Network for Urban Street-view Image},
author = {Jianshun Zeng and Wang Li and Yanjie Lv and Shuai Gao and YuChu Qin},
journal= {arXiv preprint arXiv:2405.10504},
year = {2024}
}