中文

E3AD:一种以人为中心的端到端自主驾驶情感感知视觉-语言-动作模型

数论 2025-12-05 v1

摘要

端到端自主驾驶(AD)系统越来越多地采用视觉-语言-动作(VLA)模型,但它们通常忽略乘客的情感状态,而情感状态对舒适度和 AD 接受度至关重要。我们提出开放域端到端(OD-E2E)自主驾驶,其中自动驾驶车辆(AV)必须解读自由形式的自然语言指令,推断情感,并规划物理上可行的轨迹。我们提出 E3AD,一种情感感知 VLA 框架,通过两个受认知启发的组件增强语义理解:一个连续的效价-唤醒-支配度(VAD)情感模型,从语言中捕捉语气和紧迫性,以及一个双路径空间推理模块,融合自我视角和全局视角以实现类人的空间认知。一种以一致性为导向的训练方案,结合模态预训练与基于偏好的对齐,进一步强制情感意图与驾驶动作之间的一致性。在真实数据集上,E3AD 提升了视觉基础和航点规划能力,并在情感估计方面达到了最先进的(SOTA)VAD 相关性。这些评估结果表明,将情感注入 VLA 风格的驾驶可产生更以人为中心的基础、规划和反馈。

关键词

引用

@article{arxiv.2512.04732,
  title  = {Potential Automorphy of K3 Surfaces with Large Picard Rank},
  author = {Chao Gu},
  journal= {arXiv preprint arXiv:2512.04732},
  year   = {2025}
}