面向安全自主驾驶的C-CoT:基于视觉语言模型的反事实链式思考
计算机视觉与模式识别
2026-05-12 v1 机器人学
摘要
复杂环境下的安全性关键规划,尤其是在城市交叉口,仍是自主驾驶的根本性挑战。现有方法,无论是基于规则还是数据驱动,经常难以捕获复杂的场景语义、推断潜在风险,在罕见的高风险情境中做出可靠决策。虽然视觉语言模型(VLM)为这些环境中的安全决策提供了有前景的ethods,但大多数当前方法缺乏反思和因果推理,限制了其整体鲁棒性。为此,我们提出一种反事实链式思考(C-CoT)框架,利用VLM将驾驶决策分解为五个顺序阶段:场景描述、关键目标识别、风险预测、反事实风险推理和最终行动规划。在反事实推理阶段,我们引入结构化的meta-action评估树,显式评估替代行动组合的潜在后果。这种自反思推理在行动选择和安全结果之间建立因果联系,提高了在长尾和分布外情境中的鲁棒性。为验证我们的方法,基于DeepAccident基准构建了DeepAccident-CCoT数据集,并使用低秩适配对Qwen2.5-VL(7B)模型进行微调。我们的模型实现了81.9%的风险预测召回率,将碰撞率降至3.52%,将L2误差降至1.98米。消融研究进一步确认反事实推理和meta-action评估树在增强安全性和可解释性方面的关键作用。
引用
@article{arxiv.2605.10744,
title = {C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving},
author = {Kefei Tian and Yuansheng Lian and Kai Yang and Xiangdong Chen and Shen Li},
journal= {arXiv preprint arXiv:2605.10744},
year = {2026}
}