基于双模态循环神经模型端到端音视觉语音活动检测
计算与语言
2023-05-15 v1 计算机视觉与模式识别
音频与语音处理
摘要
语音活动检测(SAD)在当前语音处理系统(包括自动语音识别(ASR))中起着重要作用。SAD 在存在声学噪声的环境中尤为困难。一种实用的解决方案是引入视觉信息,以提升 SAD 方法的鲁棒性。音视觉系统具有对不同的语音模式(如耳语)或背景噪声鲁棒的优势。近期使用深度学习的音视觉语音处理进展,为以原则性方式捕捉声学与视觉特征间的时间关系提供了机会。本研究探索该思路,提出一种用于 SAD 的\emph{双模态循环神经网络}(BRNN)框架。该方法对序列音视觉数据的时间动态进行建模,提升了所提 SAD 系统的准确率与鲁棒性。本研究不估计手工特征,而是探究端到端训练方法,其中声学与视觉特征在训练期间直接从原始数据学习。实验评估考虑了一个大型音视觉语料库,包含来自 105 位说话人的超过 60.8 小时录音。结果表明,在实际场景下,所提框架相较仅使用音频、由深度神经网络(DNN)实现的 VAD 基线绝对提升达 1.2%。在噪声声学环境下使用便携式平板传感器评估时,所提方法取得了 92.7% 的 F1 分数,仅比理想条件(如由高清摄像头与近讲麦克风获得的干净语音)下的性能低 1.0%。
引用
@article{arxiv.1809.04553,
title = {End-to-end Audiovisual Speech Activity Detection with Bimodal Recurrent Neural Models},
author = {Fei Tao and Carlos Busso},
journal= {arXiv preprint arXiv:1809.04553},
year = {2023}
}
备注
Submitted to Speech Communication