面向视听场景感知对话的简单基线
计算机视觉与模式识别
2019-04-12 v1 人工智能
计算与语言
机器学习
声音
音频与语音处理
摘要
近期提出的视听场景感知对话任务为以数据驱动的方式学习虚拟助手、智能音箱和汽车导航系统开辟了道路。然而,迄今为止,关于如何从大量冲击这些设备计算引擎的传感器中有效提取有意义信息,人们仍知之甚少。因此,在本文中,我们提出并仔细分析了一个端到端训练的视听场景感知对话简单基线。我们的方法利用注意力机制,以数据驱动的方式区分有用信号与干扰信号。我们在近期引入且具有挑战性的视听场景感知数据集上评估了所提出的方法,并展示了使该方法在 CIDEr 上超越当前 SOTA 20% 以上的关键特性。
引用
@article{arxiv.1904.05876,
title = {A Simple Baseline for Audio-Visual Scene-Aware Dialog},
author = {Idan Schwartz and Alexander Schwing and Tamir Hazan},
journal= {arXiv preprint arXiv:1904.05876},
year = {2019}
}
备注
Accepted to CVPR 2019