Automotive-ENV:面向车辆界面系统的多模态智能体基准测试
机器人学
2025-09-30 v2 计算与语言
摘要
多模态智能体在一般 GUI 交互中已展现出强大的性能,但在汽车系统中的应用仍有限。车载 GUI 提供独特的挑战:驾驶员注意力有限、安全要求严格、复杂的位置依赖交互模式。为解决这些挑战,我们引入 Automotive-ENV,这是一个为车载 GUI 量身定制的首个高保真基准测试和交互环境。该平台定义了185个参数化任务,涵盖显式控制、隐式意图理解和安全感知任务,提供结构化的多模态观察,以及精确的程序化检查,以实现可重复的评估。建立在该基准之上,我们提出 ASURADA,一个基于 GPS 信息的地理感知多模态智能体,将位置、环境条件和地区驾驶规范相结合,以动态调整动作。实验表明,地理感知信息在安全感知任务上的成功率显著提高,凸显了在汽车环境中位置相关背景的重要性。我们将发布 Automotive-ENV,包含所有任务和基准工具,以进一步发展安全且自适应的车载智能体。
引用
@article{arxiv.2509.21143,
title = {Automotive-ENV: Benchmarking Multimodal Agents in Vehicle Interface Systems},
author = {Junfeng Yan and Biao Wu and Meng Fang and Ling Chen},
journal= {arXiv preprint arXiv:2509.21143},
year = {2025}
}
备注
10 pages, 5 figures,