中文

面向音视觉场景感知对话的上下文、注意力与音频特征探索

计算与语言 2018-12-21 v1

摘要

随着人工智能的最新进展,智能虚拟助手(IVA)已成为每个家庭 ubiquitous 的一部分。展望未来,我们正见证视觉、语音与对话系统技术的融合,使IVA能够学习话语的音视觉接地,并与用户围绕周围的物体、活动和事件进行对话。作为第7届对话系统技术挑战赛(DSTC7)音视觉场景感知对话(AVSD)赛道的一部分,我们将对话的“话题”作为一种重要的上下文特征引入架构,并对多模态注意力进行了探索。我们还将端到端音频分类ConvNet——AclNet——整合进我们的模型中。我们给出了实验的详细分析,并表明我们的部分模型变体优于为该任务提出的基线系统。

关键词

引用

@article{arxiv.1812.08407,
  title  = {Context, Attention and Audio Feature Explorations for Audio Visual Scene-Aware Dialog},
  author = {Shachi H Kumar and Eda Okur and Saurav Sahay and Juan Jose Alvarado Leanos and Jonathan Huang and Lama Nachman},
  journal= {arXiv preprint arXiv:1812.08407},
  year   = {2018}
}

备注

7 pages, 2 figures, DSTC7 workshop at AAAI 2019