中文

基于 WFST 与 seq2seq 模型的音视频决策融合

音频与语音处理 2020-01-30 v1 机器学习 多媒体 声音 图像与视频处理

摘要

在噪声条件下,语音识别系统的词错误率(WER)较高。在此类情况下,包含说话人唇部运动的视觉模态信息有助于提升性能。本工作中,我们提出在推理时融合音频与视觉模态信息的新方法。这使我们能够独立训练声学与视觉模型。首先,我们训练独立的基于 RNN-HMM 的声学与视觉模型。通过取 HMM 分量特殊并集生成的通用 WFST 用于基于改进 Viterbi 算法的解码。其次,我们训练独立的 seq2seq 声学与视觉模型。解码步骤通过浅融合对两种模态同时执行,同时保持公共假设束。我们还给出了一种无加权参数的新型 seq2seq 融合结果。我们在不同信噪比(SNR)下给出结果,并表明我们的方法相较仅声学 WER 有显著改进。

关键词

引用

@article{arxiv.2001.10832,
  title  = {Audio-Visual Decision Fusion for WFST-based and seq2seq Models},
  author = {Rohith Aralikatti and Sharad Roy and Abhinav Thanda and Dilip Kumar Margam and Pujitha Appan Kandala and Tanay Sharma and Shankar M Venkatesan},
  journal= {arXiv preprint arXiv:2001.10832},
  year   = {2020}
}

备注

Submitted for review to ICASSP 2020 on October 21st, 2019