一种用于相机-激光雷达融合交通对象分割的新型视觉Transformer
计算机视觉与模式识别
2025-01-07 v1
摘要
本文提出了相机-激光雷达融合Transformer(CLFT)模型用于交通对象分割,该模型利用视觉Transformer融合相机和激光雷达数据。基于利用自注意力机制的视觉Transformer方法,我们扩展了分割能力,增加了额外的分类选项,以应对包括骑行者、交通标志和行人在内的多种对象类别,且适用于不同天气条件。尽管性能良好,但模型在恶劣条件下仍面临挑战,这凸显了进一步优化的必要性,以增强在黑暗和雨天中的性能。总之,CLFT模型为自动驾驶感知提供了一种有吸引力的解决方案,推动了多模态融合和对象分割的最新进展,但仍需持续努力以解决现有局限性并充分发挥其在实际部署中的潜力。
引用
@article{arxiv.2501.02858,
title = {A Novel Vision Transformer for Camera-LiDAR Fusion based Traffic Object Segmentation},
author = {Toomas Tahves and Junyi Gu and Mauro Bellone and Raivo Sell},
journal= {arXiv preprint arXiv:2501.02858},
year = {2025}
}
备注
International Conference on Agents and Artificial Intelligence 2025