AV Taris:在线音视频语音识别
音频与语音处理
2020-12-15 v1 机器学习
摘要
近年来,在相对干净的听音条件下,自动语音识别(ASR)技术在对话语音上已接近人类水平表现。在涉及远距离麦克风、重叠语音、背景噪声或自然对话结构的更严苛场景中,ASR错误率至少高出一个数量级。语音的视觉模态具有部分克服这些挑战的潜力,并有助于说话人日志、语音活动检测以及发音部位恢复等子任务,且平均可补偿高达15dB的噪声。本文开发了AV Taris,一种能够实时解码音视频语音的全可微神经网络模型。我们通过连接两种近期提出的用于音视频语音整合与在线语音识别的模型,即AV Align和Taris,实现了这一点。我们在与AV Align和Taris相同的条件下,在最大的公开可用音视频语音数据集之一LRS2上评估AV Taris。我们的结果表明,AV Taris优于Taris的纯音频变体,证明了在Taris定义的实时解码框架内视觉模态对语音识别的效用。相较于利用完整句子但不满足实时要求的等效基于Transformer的AV Align模型,我们报告AV Taris的绝对性能下降约为3%。与更流行的在线语音识别替代方案即RNN Transducer相比,Taris提供了极大简化的全可微训练流程。因此,AV Taris有潜力推动音视频语音识别(AVSR)技术的采用,并克服音频模态在较不理想听音条件下的固有局限。
引用
@article{arxiv.2012.07467,
title = {AV Taris: Online Audio-Visual Speech Recognition},
author = {George Sterpu and Naomi Harte},
journal= {arXiv preprint arXiv:2012.07467},
year = {2020}
}