中文

利用大语言模型自动化自动驾驶汽车通信的 eHMI 动作设计

人机交互 2025-10-13 v2 机器人学

摘要

自动驾驶汽车(AVs)与其他道路使用者之间缺乏明确的通信渠道,这要求在不确定场景下使用外部人机界面(eHMIs)来有效传达信息。目前,大多数 eHMI 研究采用预定义的文本消息和手动设计的动作来执行这些消息,这限制了 eHMI 在现实世界中的部署,因为在动态场景中适应性至关重要。鉴于大语言模型(LLMs)的泛化性和多功能性,它们有可能在消息-动作设计任务中充当自动化的动作设计器。为了验证这一想法,我们做出了三项贡献:(1)我们提出了一个集成 LLMs 和 3D 渲染器的流程,使用 LLMs 作为动作设计器来生成用于控制 eHMI 和渲染动作剪辑的可执行动作。(2)我们收集了一个用户评分的动作设计评分数据集,该数据集包含针对八种预期消息和四种代表性 eHMI 模态的总共 320 个动作序列。该数据集验证了 LLMs 能够将预期消息转化为接近人类水平的动作,特别是对于具备推理能力的 LLMs。(3)我们引入了两种自动评分器,动作参考评分(ARS)和视觉-语言模型(VLMs),对 18 个 LLMs 进行基准测试,发现 VLM 与人类偏好一致,但在不同 eHMI 模态间存在差异。

关键词

引用

@article{arxiv.2505.20711,
  title  = {Automating eHMI Action Design with LLMs for Automated Vehicle Communication},
  author = {Ding Xia and Xinyue Gui and Fan Gao and Dongyuan Li and Mark Colley and Takeo Igarashi},
  journal= {arXiv preprint arXiv:2505.20711},
  year   = {2025}
}

备注

Accepted as findings for EMNLP 2025