中文

Traffic-MLLM: 基于好奇心正则化的监督学习用于交通场景案例推理

计算机视觉与模式识别 2026-03-10 v2

摘要

为了实现安全稳健的自动驾驶,决策系统必须有效地利用过往经验来处理交通场景中固有的长尾分布问题。案例基础推理(Case-Based Reasoning, CBR)提供了一种自然的范式,通过适应先前案例中的解决方案来实现这一目标。然而,在复杂且动态的交通环境中,传统的CBR方法在不确定性下难以有效抽象和迁移知识。虽然多模态大语言模型(Multimodal Large Language Model, MLLM)在感知和语言能力方面表现出强大能力,但其推理行为往往依赖于经验性模式匹配,这限制了在分布迁移和长尾场景下的鲁棒性。我们提出了Traffic-MLLM,这是一种面向多模态交通推理的无检索神经案例建模框架。不同于在推理阶段进行显式案例检索,Traffic-MLLM在训练期间直接学习结构化且可泛化的案例空间。为支持这一学习过程,我们构建了一个多来源案例库,通过整合动态交通视频和大规模静态视觉问答数据,作为学习结构化案例表示的统一训练基质。为进一步提升知识边界附近的表示质量,我们引入基于随机网络蒸馏(Random Network Distillation, RND)的好奇心驱动的细化机制,鼓励模型内部化跨案例的结构规律,而非表面关联。在SUTD-TrafficQA和DriveQA基准测试上的实验结果表明,Traffic-MLLM在动态推理、法规理解和跨域迁移方面均实现了一致的改进。Traffic-MLLM在SUTD-TrafficQA上达到50.8%的准确率,CARLA-based DriveQA split上达到74.8%,真实世界的Mapillary split上达到83.1%,表明表示级案例空间细化为可扩展的多模态案例适配提供了有效替代方案。

关键词

引用

@article{arxiv.2509.11165,
  title  = {Traffic-MLLM: Curiosity-Regularized Supervised Learning for Traffic Scenario Case-Based Reasoning},
  author = {Waikit Xiu and Qiang Lu and Bingchen Liu and Chen Sun and Xiying Li},
  journal= {arXiv preprint arXiv:2509.11165},
  year   = {2026}
}