中文

面向自适应自动驾驶的统一感知-语言-动作框架

机器人学 2025-08-01 v1 人工智能 计算机视觉与模式识别

摘要

自动驾驶系统面临在复杂开放世界环境中实现类人可适应性、稳健性和可解释性的重大挑战。这些挑战源于体系结构碎片化、对新情景的泛化能力有限,以及从感知中提取不足的语义信息。为此,我们提出了统一的感知-语言-动作(Perception-Language-Action, PLA)框架,将多传感器融合(摄像头、激光雷达、雷达)与大语言模型(Large Language Model, LLM)增强的视觉-语言-动作(Vision-Language-Action, VLA)架构集成在一起,具体为GPT-4.1驱动的推理核心。该框架统一了低级感知处理与高级语境推理,紧密地将感知与基于自然语言的语义理解和决策相结合,以实现情境感知、可解释和受限安全的自动驾驶。针对建筑工地的城市交叉口场景进行评估,显示在轨迹跟踪、速度预测和自适应规划方面表现优异。结果凸显了语言增强认知框架在推进自动驾驶系统的安全性、可解释性和可扩展性方面的潜在意义。

关键词

引用

@article{arxiv.2507.23540,
  title  = {A Unified Perception-Language-Action Framework for Adaptive Autonomous Driving},
  author = {Yi Zhang and Erik Leo Haß and Kuo-Yi Chao and Nenad Petrovic and Yinglei Song and Chengdong Wu and Alois Knoll},
  journal= {arXiv preprint arXiv:2507.23540},
  year   = {2025}
}