运动声源场景下注意力驱动的多通道语音增强
音频与语音处理
2023-12-19 v1 机器学习
信号处理
摘要
当前的多通道语音增强算法通常假设声源是静止的,这一与现实的常见失配限制了它们在真实场景中的性能。本文专注于为动态环境设计的注意力驱动空间滤波技术。具体而言,我们研究了基于线性和非线性注意力的方法在估计用于设计滤波器的时变空间协方差矩阵中的应用。我们还研究了通过基于注意力的方法直接估计空间滤波器,而无需显式估计空间统计量。采用 WSJ0 中的纯净语音片段来模拟混响环境中移动说话人的语音信号。实验数据集通过将模拟的语音信号与来自 CHiME-3 的多通道真实噪声混合构建而成。评估结果表明,注意力驱动的方法具有鲁棒性,并且在静态和动态声学环境中均始终优于传统的空间滤波方法。
引用
@article{arxiv.2312.10756,
title = {Attention-Driven Multichannel Speech Enhancement in Moving Sound Source Scenarios},
author = {Yuzhu Wang and Archontis Politis and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2312.10756},
year = {2023}
}