面向舱内对话代理的乘客意图音视觉理解
计算与语言
2020-07-09 v1
摘要
构建位于舱内语境下的多模态对话理解能力对于提升自动驾驶汽车(AV)交互系统中的乘客舒适度至关重要。为此,从语音交互和车载视觉系统理解乘客意图是开发 AV 具有语境性和视觉接地对话代理的关键组成部分。针对该目标,我们探索 AMIE(Automated-vehicle Multimodal In-cabin Experience),即负责处理多模态乘客-车辆交互的舱内代理。在本工作中,我们讨论了通过结合语言/言语输入与来自车内外的非言语/声学及视觉线索来实现舱内话语多模态理解的优势。我们的实验结果表明,采用多模态方法在意图检测上取得了优于仅文本基线的性能提升。
引用
@article{arxiv.2007.03876,
title = {Audio-Visual Understanding of Passenger Intents for In-Cabin Conversational Agents},
author = {Eda Okur and Shachi H Kumar and Saurav Sahay and Lama Nachman},
journal= {arXiv preprint arXiv:2007.03876},
year = {2020}
}
备注
ACL 2020 - Second Grand-Challenge and Workshop on Multimodal Language (Challenge-HML)