中文

基于LiDAR轨迹的街景视频时空对象描述

计算机视觉与模式识别 2025-05-23 v1 机器学习

摘要

视频描述模型在最近几年取得了显著进展,尤其是在捕捉时序信息方面。尽管许多研究努力集中于架构创新,如时序注意力机制,但仍存在关于模型如何捕获和利用时序语义以有效进行时序特征提取的空白,尤其是在高级驾驶辅助系统(ADAS)的上下文中。我们提出一种自动化的基于LiDAR的描述程序,专注于交通参与者的时序动态。我们的ethods使用基于规则的系统从对象轨迹中提取关键细节,如车道位置和相对运动,然后进行基于模板的描述生成。我们的发现表明,使用我们专为封装细粒度时序行为而设计的基于模板的描述对SwinBERT进行训练,仅使用前置摄像头图像,监督训练显著提高了时序理解,始终如一地在三个数据集上表现良好。总之,我们的结果清晰地表明,将LiDAR基于的描述监督信息整合显著增强了时序理解,有效地解决了当前最先进模型架构中固有的视觉/静态偏见问题。

关键词

引用

@article{arxiv.2505.16594,
  title  = {Temporal Object Captioning for Street Scene Videos from LiDAR Tracks},
  author = {Vignesh Gopinathan and Urs Zimmermann and Michael Arnold and Matthias Rottmann},
  journal= {arXiv preprint arXiv:2505.16594},
  year   = {2025}
}