用于 4D 雷达场景流估计的弱监督跨模态学习
计算机视觉与模式识别
2026-05-22 v3
摘要
由于获取 4D 雷达场景流估计的真值数据存在困难,以往方法通常依赖自监督损失或使用 3D LiDAR 数据、2D 图像与里程计的跨模态监督。然而,由于雷达固有的低保真度测量,自监督方法通常产生次优结果;而现有的跨模态监督方法引入了复杂的多任务架构,并需要昂贵的 LiDAR 传感器从预训练 3D 跟踪模型生成伪雷达场景流标签。为克服这些局限性,我们提出了一种用于弱监督雷达场景流学习的任务特定迭代框架,在训练期间仅使用图像与里程计进行辅助监督。具体而言,我们利用现成的 2D 跟踪与分割算法获取被跟踪的实例掩码,并将其反投影至 3D 空间以提供实例级语义指导,从而建立了两种新颖的实例感知自监督损失;对于静态区域,我们将车辆里程计与雷达的固有运动线索相结合以构建刚性静态损失。在真实世界 View-of-Delft (VoD) 数据集上的大量实验表明,我们的方法不仅超越了依赖密集 LiDAR 点云上 3D 多目标跟踪的 SOTA 跨模态监督方法,还优于现有的全监督场景流估计方法。代码已开源于 \href{https://github.com/FuJingyun/IterFlow}{https://github.com/FuJingyun/IterFlow}。
引用
@article{arxiv.2605.18507,
title = {Weakly Supervised Cross-Modal Learning for 4D Radar Scene Flow Estimation},
author = {Jingyun Fu and Zhiyu Xiang and Na Zhao},
journal= {arXiv preprint arXiv:2605.18507},
year = {2026}
}
备注
Accepted by ICML2026