中文

噪声环境下的大词汇量视听语音识别

音频与语音处理 2021-09-13 v1 声音 图像与视频处理

摘要

与纯音频系统相比,视听语音识别(AVSR)能够有效且显著地提高小词汇量系统的识别率。然而,对于大词汇量系统,仍存在诸多困难,例如视频识别准确率不理想,这使得其难以超越纯音频基线。在本文中,我们专门考虑此类场景,重点关注 LRS2 数据库的大词汇量任务。在该任务中,纯音频性能远优于纯视频准确率,这使得其成为多模态融合的一个有趣且具挑战性的设置。为解决固有困难,我们提出了一种新的融合策略:训练一个循环积分网络,在一组基于模型和基于信号的流可靠性测度的引导下,融合多个单模态模型的状态后验概率。在解码过程中,该网络用于混合识别器内的流融合,从而能够应对其多个特征输入的时变可靠性与信息量。我们将结果与端到端 AVSR 系统以及具有竞争力的混合基线模型进行比较,发现这种新的融合策略展现出更优的结果,平均而言甚至超越了 oracle 动态流加权,而后者迄今为止标志着标准流加权的——现实中无法达到的——性能上界。尽管纯唇读性能较低,但在所有——干净、噪声和混响——条件下,视听融合均有所帮助。平均而言,与纯音频模型相比,新系统实现了 42.18% 的相对词错误率降低,表明所提出的融合方法具有很高的有效性。

关键词

引用

@article{arxiv.2109.04894,
  title  = {Large-vocabulary Audio-visual Speech Recognition in Noisy Environments},
  author = {Wentao Yu and Steffen Zeiler and Dorothea Kolossa},
  journal= {arXiv preprint arXiv:2109.04894},
  year   = {2021}
}