从人类意图到动作预测:意图驱动的端到端自动驾驶
计算机视觉与模式识别
2026-01-08 v2 计算与语言
机器人学
摘要
尽管端到端自动驾驶在几何控制方面取得了显著进展,但当前系统仍受限于依赖简单导航指令的命令遵循范式。实现真正智能的代理人需要具备解释和满足高层次、抽象人类意图的能力。然而,这一进步受限于缺乏专门的基准测试和语义感知的评估指标。本文正式定义了意图驱动的端到端自动驾驶任务,并提出 Intention-Drive 一个综合性基准,以弥合这一差距。我们构建了一个大规模数据集,包含复杂自然语言意图与高保真传感器数据。为克服常规轨迹基准的局限性,我们引入想象未来对齐 (IFA),一种利用生成式世界模型进行的新型评估协议,用于衡量人类目标语义实现,超越单纯的几何精度。此外,我们通过提出两种不同范式来探索解决方案空间:一种是端到端视觉语言规划器,一种是层次化代理框架。实验结果揭示了一个关键二分法:现有模型在驾驶稳定性方面表现满意,但在意图满足方面存在显著困难。值得注意的是,所提出的框架在与人类意图的对齐方面表现优异。
引用
@article{arxiv.2512.12302,
title = {From Human Intention to Action Prediction: Intention-Driven End-to-End Autonomous Driving},
author = {Huan Zheng and Yucheng Zhou and Tianyi Yan and Jiayi Su and Hongjun Chen and Dubing Chen and Xingtai Gui and Wencheng Han and Runzhou Tao and Zhongying Qiu and Jianfei Yang and Jianbing Shen},
journal= {arXiv preprint arXiv:2512.12302},
year = {2026}
}