面向可懂度的音视觉语音增强
声音
2021-11-19 v1 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
现有的基于深度学习(DL)的语音增强方法通常优化以最小化干净语音与增强语音特征之间的距离。这些方法常改善语音质量,但缺乏泛化能力,且在真实噪声环境中可能无法提供所需语音可懂度。为应对这些挑战,研究者已探索面向可懂度(I-O)的损失函数以及音视觉(AV)信息集成以实现更鲁棒的语音增强(SE)。本文中,我们引入利用AV信息的基于DL的I-O SE算法,这是新颖且此前未被探索的研究方向。具体地,我们提出一个全卷积AV SE模型,其使用改进的短时客观可懂度(STOI)度量作为训练代价函数。据我们所知,这是首项将AV模态与基于I-O的损失函数集成用于SE的工作。对比实验结果表明,在处理未见说话人与噪声时,我们提出的I-O AV SE框架在标准客观评价指标上优于使用传统基于距离损失函数训练的纯音频(AO)与AV模型。
引用
@article{arxiv.2111.09642,
title = {Towards Intelligibility-Oriented Audio-Visual Speech Enhancement},
author = {Tassadaq Hussain and Mandar Gogate and Kia Dashtipour and Amir Hussain},
journal= {arXiv preprint arXiv:2111.09642},
year = {2021}
}
备注
6 pages, 4 figures