中文

VM-UNSSOR: 基于高信噪比虚拟麦克风阵列增强的无监督神经语音分离

声音 2025-10-13 v1 音频与语音处理

摘要

盲语音分离(BSS)旨在从多通道、多说话人的混合语音中恢复多个语音源,在阵列几何结构和房间脉冲响应均未知的条件下进行。在无监督设置中,由于训练时无法获得纯净目标语音,UNSSOR 提出了一种混合一致性(MC)损失,用于在过定训练混合上训练深度神经网络(DNN),以实现无监督语音分离。然而,当训练混合的麦克风数量减少时,MC 约束会减弱,分离性能急剧下降。为解决这一问题,我们提出 VM-UNSSOR,通过向有限麦克风记录的观测训练混合信号中注入若干高信噪比的虚拟麦克风(VM)信号对其进行增强,这些虚拟麦克风信号通过对观测训练混合施加线性空间解混器(如 IVA 和空间聚类)获得。作为观测混合的线性投影,虚拟麦克风信号通常可以提高各源的信噪比,并可用于计算额外的 MC 损失以改进 UNSSOR,同时解决 UNSSOR 中的频率排列问题。在 SMS-WSJ 数据集上,在过定六麦克风、两说话人分离设置中,VM-UNSSOR 达到 17.1 dB SI-SDR,而 UNSSOR 仅获得 14.7 dB;在确定性两麦克风、两说话人情况下,UNSSOR 崩溃至 -2.7 dB SI-SDR,而 VM-UNSSOR 达到 10.7 dB。

关键词

引用

@article{arxiv.2510.08914,
  title  = {VM-UNSSOR: Unsupervised Neural Speech Separation Enhanced by Higher-SNR Virtual Microphone Arrays},
  author = {Shulin He and Zhong-Qiu Wang},
  journal= {arXiv preprint arXiv:2510.08914},
  year   = {2025}
}