探索上下文、注意力与音频特征在视听场景感知对话中的作用
计算与语言
2019-12-27 v1
摘要
我们正见证视觉、语音与对话系统技术的融合,使 IVA 能够学习话语的视听基础,并与用户围绕其周围的物体、活动和事件进行对话。视觉基础技术与音频理解的最新进展,使机器能够理解共享语义概念并聆听环境中的各种感官事件。借助音频与视觉基础方法,端到端多模态口语对话系统(SDS)被训练得以自然语言就我们周围真实的动态视听感官世界进行有意义的交流。在本工作中,我们探索将“主题”作为对话上下文,并结合多模态注意力,引入此类端到端视听场景感知对话系统架构中。我们还将端到端音频分类卷积网络 AclNet 整合进我们的模型。我们在作为 DSTC7 一部分发布的视听场景感知对话(AVSD)数据集上开发并测试了我们的方法。我们给出了实验分析,并表明我们的部分模型变体优于为 AVSD 发布的基线系统。
引用
@article{arxiv.1912.10132,
title = {Exploring Context, Attention and Audio Features for Audio Visual Scene-Aware Dialog},
author = {Shachi H Kumar and Eda Okur and Saurav Sahay and Jonathan Huang and Lama Nachman},
journal= {arXiv preprint arXiv:1912.10132},
year = {2019}
}
备注
Presented at the Visual Question Answering and Dialog Workshop, CVPR 2019, Long Beach, USA. arXiv admin note: substantial text overlap with arXiv:1912.10131