高效的基于区域的说话人无关源分离
音频与语音处理
2024-08-20 v1 声音
摘要
本文提出了一种面向虚拟会议场景的基于区域的源分离方法。该方法旨在在线性麦克风阵列前方定义的特定空间区域内保留来自未指定数量声源的语音信号,同时抑制所有其他声音。因此,我们采用了一种适配多通道输入的高效神经网络架构,以涵盖预定义的目标区域。为评估该方法,我们模拟了训练数据和特定测试场景,包括多个目标说话人和干扰说话人以及背景噪声。所有模型均根据 DNSMOS 和尺度不变信噪比进行评分。我们的实验表明,所提出的方法能够良好地分离目标区域内多个说话人的语音,同时具有极低的复杂度,适用于实时处理。此外,功率降低热图被用于展示网络识别目标区域内声源的能力。我们将该方法与一个成熟的说话人-说话人分离基线进行了对比,并讨论了其优势和挑战。
引用
@article{arxiv.2408.09810,
title = {Efficient Area-based and Speaker-Agnostic Source Separation},
author = {Martin Strauss and Okan Köpüklü},
journal= {arXiv preprint arXiv:2408.09810},
year = {2024}
}
备注
Preprint. Accepted to the International Workshop on Acoustic Signal Enhancement (IWAENC 2024)