端到端多模态语音识别
音频与语音处理
2018-04-27 v1 计算与语言
机器学习
摘要
开放域视频的转写或字幕生成由于数据具有挑战性的声学特性、可变的信号处理以及数据本质上不受限制的领域,对自动语音识别(ASR)而言仍是一个困难领域。在先前的工作中,我们已经表明视觉通道——特别是物体与场景特征——有助于自适应识别器的声学模型(AM)与语言模型(LM),现在我们将该工作扩展到端到端方法。对于基于连接主义时序分类(CTC)的方法,我们保留 AM 与 LM 的分离;而对于序列到序列(S2S)方法,两种信息源在单一模型中共同自适应。本文还分析了 CTC 与 S2S 模型在噪声视频数据(How-To 语料库)上的表现,并与在干净的华尔街日报(WSJ)语料库上的结果进行比较,从而揭示两种方法的鲁棒性。
引用
@article{arxiv.1804.09713,
title = {End-to-End Multimodal Speech Recognition},
author = {Shruti Palaskar and Ramon Sanabria and Florian Metze},
journal= {arXiv preprint arXiv:1804.09713},
year = {2018}
}
备注
5 pages, 5 figures, Accepted at IEEE International Conference on Acoustics, Speech and Signal Processing 2018 (ICASSP 2018)