基于音视觉信息的乌尔都语唇读深度学习
计算机视觉与模式识别
2018-02-16 v1 声音
音频与语音处理
摘要
人类唇读是一项具有挑战性的任务。它不仅需要底层语言的知识,还需要视觉线索来预测所说出的单词。专家需要一定程度的经验和视觉表达学习的理解来解码所说出的单词。如今,借助深度学习,可以将唇部序列翻译成有意义的单词。在噪声环境中的语音识别可通过视觉信息得到提升[1]。为证明这一点,在本项目中,我们尝试训练两种不同的深度学习模型用于唇读:第一种用于视频序列,采用时空卷积神经网络、双向门控循环神经网络和连接主义时序分类损失;第二种用于音频,将 MFCC 特征输入到一层 LSTM 单元并输出序列。我们还收集了一个小型音视觉数据集来训练和测试我们的模型。我们的目标是整合这两个模型以改进噪声环境中的语音识别。
引用
@article{arxiv.1802.05521,
title = {Deep Learning for Lip Reading using Audio-Visual Information for Urdu Language},
author = {M Faisal and Sanaullah Manzoor},
journal= {arXiv preprint arXiv:1802.05521},
year = {2018}
}