端到端DOA引导的嘈杂多说话者场景中的语音提取
音频与语音处理
2025-07-29 v1
摘要
目标说话者提取(TSE)在嘈杂和多说话者环境中增强语音信号方面起着关键作用。本文提出了一种端到端的TSE模型,该模型结合了到达方向(DOA)和波束宽度嵌入,以从以DOA为中心的指定空间区域提取语音。我们的方法有效地捕获了空间和时间特征,从而在具有多个同时说话者的高度复杂场景中实现稳健的性能。实验结果表明,所提出的模型不仅显著增强了定义波束宽度内的目标语音,而且有效抑制了来自其他方向的干扰,产生清晰且隔离的目标语音。此外,该模型在下游自动语音识别(ASR)任务中取得了显著的改进,使其特别适用于实际应用。
引用
@article{arxiv.2507.20926,
title = {End-to-End DOA-Guided Speech Extraction in Noisy Multi-Talker Scenarios},
author = {Kangqi Jing and Wenbin Zhang and Yu Gao},
journal= {arXiv preprint arXiv:2507.20926},
year = {2025}
}
备注
Accepted by INTERSPEECH 2025