S$^3$M-Net:面向自动驾驶的语义分割与立体匹配联合学习
计算机视觉与模式识别
2024-01-30 v2 人工智能
机器人学
摘要
语义分割和立体匹配是自动驾驶 3D 环境感知系统的两个基本组件。然而,传统方法通常使用独立模型分别处理这两个问题。这种方法在实际场景中存在局限性,尤其是在计算资源匮乏或对实时性要求较高的情况下。因此,在本文中,我们介绍了 SM-Net,这是一种新颖的联合学习框架,旨在同时执行语义分割和立体匹配。具体而言,SM-Net 在两个任务之间共享从 RGB 图像中提取的特征,从而提升了整体场景理解能力。这种特征共享过程通过特征融合自适应(FFA)模块实现,该模块将共享特征有效转换至语义空间,随后将其与编码的视差特征进行融合。整个联合学习框架通过最小化一种新颖的语义一致性引导(SCG)损失进行训练,该损失函数强调两个任务中的结构一致性。在 vKITTI2 和 KITTI 数据集上进行的大量实验结果证明了我们提出的联合学习框架的有效性,以及其相较于其他 SOTA 单任务网络的优越性能。我们的项目网页可通过 mias.group/S3M-Net 访问。
引用
@article{arxiv.2401.11414,
title = {S$^3$M-Net: Joint Learning of Semantic Segmentation and Stereo Matching for Autonomous Driving},
author = {Zhiyuan Wu and Yi Feng and Chuang-Wei Liu and Fisher Yu and Qijun Chen and Rui Fan},
journal= {arXiv preprint arXiv:2401.11414},
year = {2024}
}
备注
accepted to IEEE Trans. on Intelligent Vehicles (T-IV)