中文

用于多视图遥感图像分割的隐式射线Transformer

计算机视觉与模式识别 2023-08-09 v1 人工智能

摘要

主流的基于 CNN 的遥感(RS)图像语义分割方法通常依赖大量标注训练数据。由于未考虑场景内的 3D 信息,此类范式在仅有少量标注视图的 RS 多视图场景分割问题上表现不佳。本文提出基于隐式神经表示(INR)的“隐式射线Transformer(IRT)”,用于稀疏标注(如每 100 张图像 4–6 个标注)下的 RS 场景语义分割。我们探索了一种将多视图 3D 结构先验引入该任务以实现准确且视图一致的语义分割的新途径。所提方法包含两阶段学习过程。第一阶段,我们优化一个神经场,基于多视图图像编码遥感场景的颜色与 3D 结构。第二阶段,我们设计 Ray Transformer 以利用神经场 3D 特征与 2D 纹理特征之间的关系学习更优语义表示。与以往仅考虑 3D 先验或 2D 特征的方法不同,我们通过将 CNN 特征沿采样射线广播至不同点特征,融合了额外的 2D 纹理信息与 3D 先验。为验证所提方法有效性,我们构建了一个具有挑战性的数据集,包含从 Carla 平台收集的六个合成子数据集以及来自 Google Maps 的三个真实子数据集。实验表明,所提方法在定量与定性指标上均优于基于 CNN 的方法及最先进的基于 INR 的分割方法。

关键词

引用

@article{arxiv.2303.08401,
  title  = {Implicit Ray-Transformers for Multi-view Remote Sensing Image Segmentation},
  author = {Zipeng Qi and Hao Chen and Chenyang Liu and Zhenwei Shi and Zhengxia Zou},
  journal= {arXiv preprint arXiv:2303.08401},
  year   = {2023}
}