作为桥梁的信息协调:面向可靠自动驾驶场景理解的神经符号架构
计算机视觉与模式识别
2026-05-07 v1
摘要
可靠的自动驾驶要求场景理解在异构传感器之间保持语义一致,并在推理阶段可验证。然而,许多近期由LLM驱动的驾驶系统将语言模型作为后处理器,迫使其对冗余或冲突的感知输出进行推理,这可能会放大幻觉实体与不安全结论。本文提出InfoCoordiBridge,一种以BEV为中心的神经符号架构,在感知与语言推理之间插入显式的协调桥梁。InfoCoordiBridge包含:(i) 统一的多智能体感知层,输出类型化结构化事实以及聚焦模态的摘要;(ii) ICA模块,将多源输出对齐并融合为单一的SceneSummary;(iii) SSRE模块,基于SceneSummary进行带验证的推理。在nuScenes和Waymo上的实验表明,ICA在保持具竞争力的3D检测精度的同时,显著提升了融合一致性,将冗余降至1%以下,并实现了约98%的属性一致性。在NuScenes-QA和模板对齐的Waymo-QA基准上,与代表性的VLM和智能体基线相比,SSRE提升了事实基础并减少了幻觉实体提及。总体而言,通过在提示前将多传感器输出协调为单一的冲突感知SceneSummary,InfoCoordiBridge防止了冗余和跨模态不一致的感知证据传播至高层推理。
引用
@article{arxiv.2605.04475,
title = {Information Coordination as a Bridge: A Neuro-Symbolic Architecture for Reliable Autonomous Driving Scene Understanding},
author = {Shuo Liu and Lei Shi and Haowen Liu and Jing Xu and Yufei Gao and Yucheng Shi},
journal= {arXiv preprint arXiv:2605.04475},
year = {2026}
}