中文

释放无标签数据在语言驾驶模型中的潜力

计算机视觉与模式识别 2025-03-18 v2

摘要

近期用于自动驾驶的基于视觉的大语言模型(VisionLLMs)取得了快速进展. 然而,此类提升极度依赖大规模高质量标注数据,成本高昂且劳动密集. 为解决此问题,我们提出利用丰富但无标签的数据,以半监督学习方式提升语言驾驶模型. 具体而言,我们首先引入一系列基于模板的提示以提取场景信息,生成基于有限标注数据训练的模型为无标签数据创建的伪答案. 接下来,我们提出一种自一致性精化方法以提升这些伪标注的质量,随后用于进一步训练. 利用预训练的 VisionLLM(例如 InternVL),我们构建了一个强大的语言驾驶模型(LDM),用于驾驶场景问答,在 DriveLM 基准测试上超越了先前最先进方法. 大量实验表明,我们的方法仅使用 5% 的标注数据即表现良好,达到了与全数据集训练模型相当的性能. 具体地,我们的 LDM 在有限标注数据下达到 44.85% 的性能,使用无标签数据后提升至 54.27%,而全数据集训练的模型在 DriveLM 基准上达到 60.68%.

关键词

引用

@article{arxiv.2503.10586,
  title  = {Unlock the Power of Unlabeled Data in Language Driving Model},
  author = {Chaoqun Wang and Jie Yang and Xiaobin Hong and Ruimao Zhang},
  journal= {arXiv preprint arXiv:2503.10586},
  year   = {2025}
}

备注

Accepted by ICRA2025