中文

用于与说话人无关的联合定位与掩码估计的掩码加权空间似然编码

音频与语音处理 2025-01-10 v2 机器学习 声音

摘要

由于鲁棒性和灵活性,神经驱动的波束形成器是在具有不同数量同时说话人以及噪声和混响的挑战性环境中进行语音分离的流行选择。时频掩码和说话人相对于固定空间网格的相对方向可用于估计波束形成器的参数。在某种程度上,通过确保空间分区数量多于语音源,可以实现与说话人无关。在这项工作中,我们分析了如何将掩码和位置信息编码到这样的网格中,以实现这两个量的联合估计。我们提出了掩码加权空间似然编码,并表明与针对定位或掩码估计优化的基线编码相比,它在两个任务中都取得了可观的性能。在相同的设置下,我们展示了其在两个量联合估计上的优越性。最后,我们提出了一种通用方法,该方法仅通过调整训练框架即可取代上游声源定位系统,使其在性能至关重要的场景中具有高度相关性。

关键词

引用

@article{arxiv.2410.19595,
  title  = {Mask-Weighted Spatial Likelihood Coding for Speaker-Independent Joint Localization and Mask Estimation},
  author = {Jakob Kienegger and Alina Mannanova and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2410.19595},
  year   = {2025}
}

备注

\copyright 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works