中文

MCRL4OR:面向越野环境感知的多模态对比表示学习

机器人学 2025-01-27 v1 人工智能 计算机视觉与模式识别

摘要

大多数关于自动驾驶车辆(AVs)环境感知的研究都聚焦于城市交通环境,其中要感知的对象/材料主要来自人造场景,且可使用密集标注的数据集来训练监督学习模型。相比之下,由于越野环境本质上具有非结构化特性,难以对大规模越野驾驶数据集进行密集标注。本文提出了一种面向越野环境感知的多模态对比表示学习方法,称为MCRL4OR。该方法旨在通过在对比学习框架中将惯性 locomotion 状态与视觉图像和控制动作融合特征对齐,联合学习三个编码器来处理视觉图像、运动状态和控制动作。这种对齐策略的因果关系在于,惯性运动状态是当前由视觉传感器感知的土地形貌/地形条件下执行某一控制动作的结果。在实验中,我们使用大规模越野驾驶数据集预训练MCRL4OR,并在越野驾驶场景中的各种下游感知任务中采用所学到的多模态表示。下游任务的优异性能表明了预训练多模态表示的优势。相关代码可在\url{https://github.com/1uciusy/MCRL4OR}获取。

关键词

引用

@article{arxiv.2501.13988,
  title  = {MCRL4OR: Multimodal Contrastive Representation Learning for Off-Road Environmental Perception},
  author = {Yi Yang and Zhang Zhang and Liang Wang},
  journal= {arXiv preprint arXiv:2501.13988},
  year   = {2025}
}

备注

Github repository: https://github.com/1uciusy/MCRL4OR