中文

基于个体化 HRTF 的立体声目标说话人提取

音频与语音处理 2026-02-25 v5 声音

摘要

本文解决了在多个同时说话人存在下的立体声目标说话人提取问题。我们提出了一种新方法,利用个体化头相关传递函数 (HRTF) 来分离目标说话人。该方法具有说话人无关性,因而不依赖说话人嵌入。我们采用全复数型神经网络直接处理混合音频信号的复数型短时傅里叶变换 (STFT),并与基于实数-虚数 (RI) 的神经网络进行比较,证明了前者的优势。我们首先在无声、无噪声的场景中评估该方法,在保持目标信号立体声线索的同时实现了优异的提取性能。随后我们将评估扩展到混响条件。实验证明,该方法稳健,既保持了语音清晰度和声源方向性,又显著降低了混响。与现有立体声目标说话人提取 (TSE) 方法进行比较分析显示,所提方法在噪声抑制和感知质量方面性能与最先进技术相当,而在保留立体声线索方面具有显著优势。演示页面: https://bi-ctse-hrtf.github.io

关键词

引用

@article{arxiv.2507.19369,
  title  = {Binaural Target Speaker Extraction using Individualized HRTF},
  author = {Yoav Ellinson and Sharon Gannot},
  journal= {arXiv preprint arXiv:2507.19369},
  year   = {2026}
}