利用面部线索的协同双注意力视听语音增强
计算机视觉与模式识别
2023-11-27 v1 声音
音频与语音处理
摘要
本工作中,我们聚焦于利用唇区之外的面部线索实现鲁棒视听语音增强(AVSE)。包含唇区的面部区域反映了性别、肤色、国籍等额外语音相关属性,有助于 AVSE 有效性。然而,也存在静态与动态的语音无关属性,导致说话时外观变化。为应对这些挑战,我们提出双注意力协同框架 DualAVSE,以忽略语音无关信息、捕捉带面部线索的语音相关信息,并将其与音频信号动态整合用于 AVSE。具体而言,我们引入基于空间注意力的视觉编码器以捕捉并增强唇区之外的视觉语音信息,结合全局面部上下文并自动忽略语音无关信息以实现鲁棒视觉特征提取。此外,通过集成时间维自注意力模块引入动态视觉特征融合策略,使模型能鲁棒处理面部变化。说话过程中的声学噪声是变化的,影响音频质量。因此,引入音频与视觉特征的动态融合策略以解决此问题。通过在视觉编码器与视听融合策略中集成协同双注意力,我们的模型有效从音频与视觉线索中提取有益语音信息用于 AVSE。在不同数据集上的详尽分析与比较,包括视觉信息不可靠或缺失的正常与困难情形,一致显示我们的模型在多项指标上优于现有方法。
引用
@article{arxiv.2311.14275,
title = {Cooperative Dual Attention for Audio-Visual Speech Enhancement with Facial Cues},
author = {Feixiang Wang and Shuang Yang and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2311.14275},
year = {2023}
}
备注
Accepted to BMVC 2023 15 pages, 2 figures