CoC-VLA:基于链式因果视觉-语言-动作模型探索对抗域迁移的自主驾驶解释性问题
机器人学
2025-11-26 v1
摘要
自动驾驶是人工智能的一个重要应用领域。近期方法已从仅关注常见场景的工作,转向处理复杂长尾情形,如细微的人类行为、交通事故及不合规驾驶模式。鉴于大语言模型在理解视觉和自然语言输入及遵循指令方面的能力,近期方法将大语言模型集成到自动驾驶系统中,以增强推理、可解释性和跨场景性能。然而,现有方法通常依赖真实数据(适用于工业部署),或依赖针对稀有或难案情形的仿真数据。缺乏有效整合两者优势的方法。为此,我们提出一种 novel VLM 指导的、面向自动驾驶的端到端对抗迁移框架,称作 CoC-VLA。该框架包含教师 VLM 模型、学生 VLM 模型及判别器。教师模型和学生模型采用统一的基础架构——链式因果视觉-语言模型 (CoC VLM),通过端到端文本适配器集成时序信息。该架构支持链式思考推理,以推断复杂驾驶逻辑。教师模型和学生模型分别在仿真数据和真实数据上进行预训练。判别器通过 novel 反向传播策略进行对抗训练,以促进学生 VLM 模型从仿真环境迁移至真实环境中处理长尾情形的能力。
引用
@article{arxiv.2511.19914,
title = {CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model},
author = {Dapeng Zhang and Fei Shen and Rui Zhao and Yinda Chen and Peng Zhi and Chenyang Li and Rui Zhou and Qingguo Zhou},
journal= {arXiv preprint arXiv:2511.19914},
year = {2025}
}