基于多模态球面图像的单帧语义分割
计算机视觉与模式识别
2023-08-21 v1
摘要
近年来,研究界对提供360度全景视角的全景图像表现出浓厚兴趣。可输入多种数据模态,并利用其互补特性基于语义分割实现更鲁棒且丰富的场景理解,以充分释放其潜力。然而,现有研究大多集中于针孔RGB-X语义分割。在本研究中,我们提出一种基于Transformer的跨模态融合架构,以弥合多模态融合与全向场景感知之间的鸿沟。我们采用失真感知模块来处理由等距柱状表示引起的极端物体形变与全景畸变。此外,在合并特征之前,我们进行跨模态交互以实现特征校正与信息交换,从而为双模态与三模态特征流传递长程上下文。在三个室内全景视角数据集上使用四种不同模态类型组合的详尽测试中,我们的方法取得了最先进的mIoU性能:Stanford2D3DS (RGB-HHA) 上60.60%、Structured3D (RGB-D-N) 上71.97%、Matterport3D (RGB-D) 上35.92%。我们计划不久后发布所有代码与训练好的模型。
引用
@article{arxiv.2308.09369,
title = {Single Frame Semantic Segmentation Using Multi-Modal Spherical Images},
author = {Suresh Guttikonda and Jason Rambach},
journal= {arXiv preprint arXiv:2308.09369},
year = {2023}
}
备注
Accepted at WACV 2024