多说话人场景下用于神经网络波束成形的目标说话人选择
音频与语音处理
2025-03-25 v1 信号处理
摘要
我们提出了一种用于端到端波束成形神经网络训练的说话人选择机制 (SSM),该机制基于最近的发现,即听者通常以一定的欠射角注视目标说话人。该机制允许神经网络模型在训练期间,基于听者和说话人的位置,学习在多说话人场景中应聚焦于哪位说话人。然而,在推理期间仅需音频信息。我们进行了声学仿真,证明了在训练中采用 SSM 的可行性和性能。结果表明,与最小方差无失真滤波器以及未使用 SSM 训练的相同神经网络模型相比,语音可懂度、质量和失真指标均有显著提升。所提方法的成功是迈向鸡尾酒会问题解决方案的重要一步。
引用
@article{arxiv.2503.18590,
title = {Target Speaker Selection for Neural Network Beamforming in Multi-Speaker Scenarios},
author = {Luan Vinícius Fiorio and Bruno Defraene and Johan David and Alex Young and Frans Widdershoven and Wim van Houtum and Ronald M. Aarts},
journal= {arXiv preprint arXiv:2503.18590},
year = {2025}
}