用于多视图遥感图像分割的隐式射线Transformer
计算机视觉与模式识别
2023-08-09 v1 人工智能
摘要
主流的基于 CNN 的遥感(RS)图像语义分割方法通常依赖大量标注训练数据。由于未考虑场景内的 3D 信息,此类范式在仅有少量标注视图的 RS 多视图场景分割问题上表现不佳。本文提出基于隐式神经表示(INR)的“隐式射线Transformer(IRT)”,用于稀疏标注(如每 100 张图像 4–6 个标注)下的 RS 场景语义分割。我们探索了一种将多视图 3D 结构先验引入该任务以实现准确且视图一致的语义分割的新途径。所提方法包含两阶段学习过程。第一阶段,我们优化一个神经场,基于多视图图像编码遥感场景的颜色与 3D 结构。第二阶段,我们设计 Ray Transformer 以利用神经场 3D 特征与 2D 纹理特征之间的关系学习更优语义表示。与以往仅考虑 3D 先验或 2D 特征的方法不同,我们通过将 CNN 特征沿采样射线广播至不同点特征,融合了额外的 2D 纹理信息与 3D 先验。为验证所提方法有效性,我们构建了一个具有挑战性的数据集,包含从 Carla 平台收集的六个合成子数据集以及来自 Google Maps 的三个真实子数据集。实验表明,所提方法在定量与定性指标上均优于基于 CNN 的方法及最先进的基于 INR 的分割方法。
引用
@article{arxiv.2303.08401,
title = {Implicit Ray-Transformers for Multi-view Remote Sensing Image Segmentation},
author = {Zipeng Qi and Hao Chen and Chenyang Liu and Zhenwei Shi and Zhengxia Zou},
journal= {arXiv preprint arXiv:2303.08401},
year = {2023}
}