重叠语音的视听多通道集成与识别
音频与语音处理
2021-08-31 v2
摘要
自动语音识别(ASR)技术在过去几十年中取得了显著进展。然而,重叠语音的识别至今仍是一项极具挑战性的任务。为此,当前 ASR 系统广泛使用多通道麦克风阵列数据。受视觉模态对声学信号损坏的不变性及其为从干扰声源中分离目标说话人所提供额外线索的启发,本文提出了一种基于视听多通道的重叠语音识别系统。它受益于语音分离前端与识别后端之间的紧密集成,二者均融入了额外的视频输入。我们开发了一系列基于 TF 掩蔽、Filter&Sum 和基于掩蔽的 MVDR 神经通道集成方法的视听多通道语音分离前端组件。为减小分离与识别组件之间的误差代价失配,整个系统使用 Si-SNR(尺度不变信噪比)与 CTC(连接主义时序分类)或 LF-MMI(无格最大互信息)损失函数的多任务准则插值进行联合微调。实验表明:所提出的视听多通道识别系统在由 LRS2 数据集通过仿真或重放构建的重叠语音上,分别比仅音频的基线多通道 ASR 系统绝对词错率降低 8.04%(相对 31.68%)和 22.86%(相对 58.51%)。在使用遮挡视频输入(面部区域随机遮挡至多 60%)时,所提出的视听多通道识别系统也获得了持续的性能提升。
引用
@article{arxiv.2011.07755,
title = {Audio-visual Multi-channel Integration and Recognition of Overlapped Speech},
author = {Jianwei Yu and Shi-Xiong Zhang and Bo Wu and Shansong Liu and Shoukang Hu and Mengzhe Geng and Xunying Liu and Helen Meng and Dong Yu},
journal= {arXiv preprint arXiv:2011.07755},
year = {2021}
}
备注
TASLP 2021