基于神经协方差估计的方向保持型MIMO语音增强
音频与语音处理
2026-04-14 v1
摘要
多通道语音增强广泛用作麦克风阵列处理系统的前端。虽然大多数现有方法产生单个增强信号,但方向保持型多输入多输出(MIMO)方法旨在提供保持方向特性的增强多通道信号,使下游应用(如波束成形、双声道渲染和方向到达估计)成为可能。本文提出一种基于神经协方差估计的全盲、方向保持型MIMO语音增强方法。一种轻量级OnlineSpatialNet估计频域噪声协方差的比例归一化Cholesky因子,该因子与方向保持型MIMO维纳滤波器结合,用于增强语音,同时保持目标和残余噪声的空间特性。与依赖虚构信息或基于掩码的协方差估计的先前方法不同,所提方法直接针对准确的多通道协方差估计,计算复杂度低。实验结果表明,所提方法在语音增强、协方差估计能力以及下游任务性能上均优于基于掩码的基线,参数更少、计算成本更低,接近虚构性能。
引用
@article{arxiv.2604.11179,
title = {Direction-Preserving MIMO Speech Enhancement Using a Neural Covariance Estimator},
author = {Thomas Deppisch},
journal= {arXiv preprint arXiv:2604.11179},
year = {2026}
}