中文

AsymFormer:面向移动平台实时 RGB-D 语义分割的非对称跨模态表示学习

计算机视觉与模式识别 2024-04-18 v7

摘要

理解室内场景对城市研究至关重要。考虑到室内环境的动态特性,有效的语义分割需要实时运行与高精度的结合。为此,我们提出 AsymFormer,一种利用 RGB-D 多模态信息提升实时语义分割精度而不显著增加网络复杂度的新型网络。AsymFormer 采用非对称骨干网络进行多模态特征提取,通过优化计算资源分布来减少冗余参数。为融合非对称多模态特征,使用了局部注意力引导特征选择(LAFS)模块,通过利用不同模态间的依赖关系有选择地融合特征。随后,引入跨模态注意力引导特征关联嵌入(CMA)模块以进一步提取跨模态表示。AsymFormer 在 NYUv2 上取得 54.1% mIoU、在 SUNRGBD 上取得 49.1% mIoU 的竞争性结果。值得注意的是,AsymFormer 在 RTX3090 上达到 65 FPS 的推理速度(实施混合精度量化后为 79 FPS),表明 AsymFormer 能在高精度与效率间取得平衡。

关键词

引用

@article{arxiv.2309.14065,
  title  = {AsymFormer: Asymmetrical Cross-Modal Representation Learning for Mobile Platform Real-Time RGB-D Semantic Segmentation},
  author = {Siqi Du and Weixi Wang and Renzhong Guo and Ruisheng Wang and Yibin Tian and Shengjun Tang},
  journal= {arXiv preprint arXiv:2309.14065},
  year   = {2024}
}