基于 GAN 的多麦克风空间目标说话人提取
音频与语音处理
2025-09-23 v1
摘要
空间目标说话人提取是在多说话人环境中提取特定说话人语音的技术,利用空间信息,如到达方向 (DoA)。尽管最近基于深度神经网络 (DNN) 的判别方法在性能上取得了显著提升,但生成方法,如生成对抗网络 (GAN),对于这一问题的潜力仍基本未被探索。本文我们演示了 GAN 能有效地利用噪声混合信号和空间信息来提取和生成目标说话人的语音。通过在判别性空间滤波模型的中间特征上进行条件控制,除了 DoA 之外,我们实现了基于高空间分辨率(5 度)的可定向目标提取,超越了最先进的判别方法在感知质量基准指标上的表现。
引用
@article{arxiv.2509.17741,
title = {GAN-Based Multi-Microphone Spatial Target Speaker Extraction},
author = {Shrishti Saha Shetu and Emanuël A. P. Habets and Andreas Brendel},
journal= {arXiv preprint arXiv:2509.17741},
year = {2025}
}