中文

面向自动驾驶中乘客-车辆交互的多模态理解:利用音视频数据的意图/槽位识别

多媒体 2019-10-01 v1 计算与语言 计算机视觉与模式识别

摘要

从口语交互与车辆视觉(车内与车外)理解乘客意图,是开发自动驾驶车辆(AV)中用于自然交互的上下文对话系统的重要基石。在本研究中,我们继续探索 AMIE(自动驾驶车辆多模态车内体验),即负责处理特定多模态乘客-车辆交互的车内智能体。当乘客向 AMIE 发出指令时,该智能体应妥善解析此类命令,综合考虑可用的三种模态(语言/文本、音频、视频)并触发 AV 系统的相应功能。我们曾通过逼真的寻宝游戏采用 Wizard-of-Oz 方案收集了一个多模态车内数据集,包含乘客与 AMIE 之间的多轮对话。在之前的探索中,我们尝试了多种基于 RNN 的模型来检测话语级意图(设定目的地、改变路线、加速、减速、停止、泊车、靠边停车、下车、开门及其他)以及与 AV 场景中待执行动作相关的意图关键词和相应槽位(位置、方位/方向、物体、手势/注视、时间引导、人物)。在近期工作中,我们拟讨论通过融合言语/语言输入(文本与语音嵌入)与来自车内外的非言语/声学及视觉输入(即来自车内视频流的乘客手势与注视,以及来自道路视角相机流的车外参照物体)来实现车内话语多模态理解的优势。我们的实验结果优于仅文本基线,且借助多模态,我们在话语级意图检测与槽位填充上取得了提升的性能。

关键词

引用

@article{arxiv.1909.13714,
  title  = {Towards Multimodal Understanding of Passenger-Vehicle Interactions in Autonomous Vehicles: Intent/Slot Recognition Utilizing Audio-Visual Data},
  author = {Eda Okur and Shachi H Kumar and Saurav Sahay and Lama Nachman},
  journal= {arXiv preprint arXiv:1909.13714},
  year   = {2019}
}

备注

Presented as a short-paper at the 23rd Workshop on the Semantics and Pragmatics of Dialogue (SemDial 2019 - LondonLogue), Sep 4-6, 2019, London, UK