消失点引导的驾驶场景视频语义分割
计算机视觉与模式识别
2024-04-29 v2
摘要
隐式跨帧对应关系的估计与高昂的计算成本长期以来一直是驾驶场景视频语义分割(VSS)面临的主要挑战。先前的工作利用关键帧、特征传播或跨帧注意力来解决这些问题。相比之下,我们首次利用消失点(VP)先验以实现更有效的分割。直观上,靠近 VP 的物体(即远离车辆)更难辨别。此外,在前向摄像头、直道和车辆直线前进运动这一常见情形下,这些物体随时间倾向于沿径向远离 VP。我们提出了一种名为 VPSeg 的新型高效 VSS 网络,其中包含两个恰好利用这对静态和动态 VP 先验的模块:稀疏到密集特征挖掘和 VP 引导运动融合。MotionVP 采用 VP 引导的运动估计来建立跨帧的显式对应关系,并帮助关注相邻帧中最相关的特征,而 DenseVP 则增强 VP 周围远处区域的微弱动态特征。这些模块在上下文-细节框架内运行,该框架在不同输入分辨率下将上下文特征与高分辨率局部特征分离,以降低计算成本。上下文特征与局部特征通过上下文化运动注意力进行整合以用于最终预测。在两个流行的驾驶分割基准 Cityscapes 和 ACDC 上的大量实验表明,VPSeg 优于先前的 SOTA 方法,且仅带来适度的计算开销。
引用
@article{arxiv.2401.15261,
title = {Vanishing-Point-Guided Video Semantic Segmentation of Driving Scenes},
author = {Diandian Guo and Deng-Ping Fan and Tongyu Lu and Christos Sakaridis and Luc Van Gool},
journal= {arXiv preprint arXiv:2401.15261},
year = {2024}
}
备注
CVPR 2024 highlight