超越单次拍摄,超越单一视角:用于更优 LiDAR 表征的跨视角与长时序蒸馏
计算机视觉与模式识别
2025-07-08 v1 机器学习
机器人学
摘要
LiDAR 表征学习旨在从大规模、易于获取的数据集中提取丰富的结构与语义信息,以减少对昂贵人工标注的依赖。然而,现有的 LiDAR 表征策略常忽略 LiDAR 序列中固有的时空线索,限制了其有效性。在本工作中,我们提出了 LiMA,一种新颖的长时序图像到 LiDAR 记忆聚合框架,能够显式捕捉更长程的时间相关性以增强 LiDAR 表征学习。LiMA 包含三个关键组件:1)跨视角聚合模块,对齐并融合相邻相机视角间的重叠区域,构建更统一且无冗余的记忆库;2)长时序特征传播机制,高效对齐并整合多帧图像特征,在 LiDAR 表征学习过程中增强时间连贯性;3)跨序列记忆对齐策略,强制驾驶序列间的一致性,提升对未见环境的泛化能力。LiMA 保持了高预训练效率,且在下游任务中不产生额外计算开销。在主流基于 LiDAR 的感知基准测试上的大量实验表明,LiMA 显著提升了 LiDAR 语义分割和 3D 目标检测的性能。我们希望这项工作能启发更有效的自动驾驶预训练范式。代码已公开供未来研究使用。
引用
@article{arxiv.2507.05260,
title = {Beyond One Shot, Beyond One Perspective: Cross-View and Long-Horizon Distillation for Better LiDAR Representations},
author = {Xiang Xu and Lingdong Kong and Song Wang and Chuanwei Zhou and Qingshan Liu},
journal= {arXiv preprint arXiv:2507.05260},
year = {2025}
}
备注
ICCV 2025; 26 pages, 12 figures, 10 tables; Code at http://github.com/Xiangxu-0103/LiMA