中文

基于情感上下文线索的噪声环境音视频语音增强

音频与语音处理 2024-02-27 v1 声音

摘要

在真实环境中,背景噪声会显著降低人类语音的可懂度和清晰度。音视频语音增强(AVSE)试图恢复语音质量,但现有方法往往效果不佳,尤其是在动态噪声条件下。本研究探讨将情感作为一种新的上下文线索纳入AVSE,假设融入情感理解可以提升语音增强性能。我们提出了一种新颖的情感感知AVSE系统,该系统利用听觉和视觉信息。它从说话者的面部标志中提取情感特征,并将其与相应的音频和视觉模态融合。这些丰富的数据作为输入,送入一个基于深度UNet的编码器-解码器网络,该网络专门设计用于协调增强情感的多模态信息融合。该网络通过编码器-解码器架构迭代地细化增强的语音表示,并由感知启发的损失函数指导联合学习和优化。我们在CMU多模态观点情感与情绪强度(CMU-MOSEI)数据集上训练和评估模型,该数据集是带有情感标注的音视频记录的丰富资源。我们的综合评估证明了情感作为AVSE上下文线索的有效性。通过整合情感特征,所提出的系统在语音质量和可懂度的客观和主观评估中均取得了显著改进,尤其是在具有挑战性的噪声环境中。与基线AVSE和纯音频语音增强系统相比,我们的方法在PESQ和STOI上表现出明显提升,表明更高的感知质量和可懂度。大规模听力测试证实了这些发现,表明人类对增强语音的理解有所改善。

关键词

引用

@article{arxiv.2402.16394,
  title  = {Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues},
  author = {Tassadaq Hussain and Kia Dashtipour and Yu Tsao and Amir Hussain},
  journal= {arXiv preprint arXiv:2402.16394},
  year   = {2024}
}