中文

TREND:基于时间预测的 LiDAR 语义学习方法

计算机视觉与模式识别 2026-03-02 v2

摘要

对 LiDAR 点云进行标记极其耗时耗力, 这催生了近期基于预训练权重的无监督 3D 表示学习方法以缓解标签负担的研究。几乎所有的现有工作都只关注单个 LiDAR 点云帧, 并忽略了自然而然的时序 LiDAR 序列, 该序列能够解释物体运动及其语义。相反, 我们提出 TREND, 即 Temporal REndering with Neural fielD (时序渲染与神经场), 通过对未来观察进行预测来学习 3D 表示。不同于遵循传统对比学习或掩码自编码范式的现有工作, TREND 通过时序嵌入方案生成跨时间的 3D 嵌入, 并通过时序神经场表示 3D 场景, 通过可微分渲染计算损失。到目前为止, TREND 是首个针对无监督 3D 表示学习引入时序预测的方法。我们在包含 NuScenes、Once 和 Waymo 的流行数据集上评估了 TREND, 用于下游 3D 目标检测任务。实验结果表明, TREND 相较于以往 SOTA 无监督 3D 预训练方法可实现最高 90% 的提升, 并在不同数据集中普遍改善各种下游模型, 表明时序预测确实为 LiDAR 感知带来了改进。

关键词

引用

@article{arxiv.2412.03054,
  title  = {TREND: Unsupervised 3D Representation Learning via Temporal Forecasting for LiDAR Perception},
  author = {Runjian Chen and Hyoungseob Park and Bo Zhang and Wenqi Shao and Ping Luo and Alex Wong},
  journal= {arXiv preprint arXiv:2412.03054},
  year   = {2026}
}