基于自监督几何与运动过滤的移动相机动态场景视频语义分割方法 MCDS-VSS
计算机视觉与模式识别
2024-09-06 v2 机器人学
摘要
自主系统(如自动驾驶汽车)依赖可靠的语义环境感知以做出决策。尽管视频语义分割取得了很大进展,但现有方法忽略了重要的归纳偏置,缺乏结构且可解释的内部表示。在本工作中,我们提出了MCDS-VSS,这是一种结构化滤波模型,学习自监督方式来估计场景几何和相机ego-motion,同时也估计外部物体的运动。我们的模型利用这些表示来提高语义分割的时序一致性,而不牺牲分割精度。MCDS-VSS遵循预测-融合方法,其中首先使用场景几何和相机运动来补偿ego-motion,然后使用残余光流来补偿动态物体的运动,最后将预测的场景特征与当前特征融合,以获得时序一致的场景分割。我们的模型将汽车场景解析为多个解耦的可解释表示,如场景几何、ego-motion和物体运动。定量评估表明,MCDS-VSS在视频序列上实现了优异的时序一致性,同时保持了具竞争力的分割性能。
关键词
引用
@article{arxiv.2405.19921,
title = {MCDS-VSS: Moving Camera Dynamic Scene Video Semantic Segmentation by Filtering with Self-Supervised Geometry and Motion},
author = {Angel Villar-Corrales and Moritz Austermann and Sven Behnke},
journal= {arXiv preprint arXiv:2405.19921},
year = {2024}
}
备注
Accepted for publication at BMVC 2024