利用混合指针网络语言模型对 ASR 词图进行上下文重打分
计算与语言
2020-05-18 v1 声音
音频与语音处理
摘要
社交媒体上上传的视频常附有文本描述。在为视频构建自动语音识别(ASR)系统时,我们可以利用此类视频元数据提供的上下文信息。本文中,我们探索通过选择性关注视频描述来进行 ASR 词图重打分。我们首先使用基于注意力的方法提取视频元数据的上下文向量表示,并将这些表示作为神经语言模型在词图重打分时的部分输入。其次,我们提出一种混合指针网络方法,以显式插值元数据中词出现的词概率。我们在语言建模与 ASR 任务上进行了实验评估,并证明两种所提方法均能通过选择性利用视频元数据带来性能提升。
引用
@article{arxiv.2005.07394,
title = {Contextualizing ASR Lattice Rescoring with Hybrid Pointer Network Language Model},
author = {Da-Rong Liu and Chunxi Liu and Frank Zhang and Gabriel Synnaeve and Yatharth Saraf and Geoffrey Zweig},
journal= {arXiv preprint arXiv:2005.07394},
year = {2020}
}