中文

LRS2 数据集上重叠语音的视听识别

音频与语音处理 2020-01-07 v1 声音

摘要

重叠语音的自动识别至今仍是一项极具挑战性的任务。受人类语音感知的双模态特性启发,本文研究了视听技术在重叠语音识别中的使用。我们解决了与构建视听语音识别(AVSR)系统相关的三个问题。首先,研究了 AVSR 系统的基本架构设计,即端到端与混合架构。其次,使用专门设计的模态融合门来鲁棒地整合音频与视觉特征。第三,与包含显式语音分离与识别组件的传统流水线架构不同,我们还提出了一种使用无格最大互信息(LF-MMI)判别准则一致优化的精简集成式 AVSR 系统。所提出的 LF-MMI 时延神经网络(TDNN)系统在 LRS2 数据集上确立了当前最优水平。在由 LRS2 数据集模拟的重叠语音上的实验表明,所提出的 AVSR 系统相较纯音频基线 LF-MMI DNN 系统在词错误率(WER)绝对降低上高出至多 29.98%,并取得了可与更复杂的流水线系统相媲美的识别性能。相较使用特征融合的基线 AVSR 系统,也一致地获得了 WER 绝对降低 4.89% 的性能提升。

关键词

引用

@article{arxiv.2001.01656,
  title  = {Audio-visual Recognition of Overlapped speech for the LRS2 dataset},
  author = {Jianwei Yu and Shi-Xiong Zhang and Jian Wu and Shahram Ghorbani and Bo Wu and Shiyin Kang and Shansong Liu and Xunying Liu and Helen Meng and Dong Yu},
  journal= {arXiv preprint arXiv:2001.01656},
  year   = {2020}
}

备注

5 pages, 5 figures, submitted to icassp2019