中文

Automotive-ENV:面向车辆界面系统的多模态智能体基准测试

机器人学 2025-09-30 v2 计算与语言

摘要

多模态智能体在一般 GUI 交互中已展现出强大的性能,但在汽车系统中的应用仍有限。车载 GUI 提供独特的挑战:驾驶员注意力有限、安全要求严格、复杂的位置依赖交互模式。为解决这些挑战,我们引入 Automotive-ENV,这是一个为车载 GUI 量身定制的首个高保真基准测试和交互环境。该平台定义了185个参数化任务,涵盖显式控制、隐式意图理解和安全感知任务,提供结构化的多模态观察,以及精确的程序化检查,以实现可重复的评估。建立在该基准之上,我们提出 ASURADA,一个基于 GPS 信息的地理感知多模态智能体,将位置、环境条件和地区驾驶规范相结合,以动态调整动作。实验表明,地理感知信息在安全感知任务上的成功率显著提高,凸显了在汽车环境中位置相关背景的重要性。我们将发布 Automotive-ENV,包含所有任务和基准工具,以进一步发展安全且自适应的车载智能体。

关键词

引用

@article{arxiv.2509.21143,
  title  = {Automotive-ENV: Benchmarking Multimodal Agents in Vehicle Interface Systems},
  author = {Junfeng Yan and Biao Wu and Meng Fang and Ling Chen},
  journal= {arXiv preprint arXiv:2509.21143},
  year   = {2025}
}

备注

10 pages, 5 figures,