中文

多通道神经说话人分割的空间感知自监督模型

音频与语音处理 2025-10-17 v1

摘要

自监督模型如WavLM已显示出对神经说话人分割具有强大的性能。然而,这些模型通常在单通道录音中进行预训练,限制了其在多通道场景中的效果。现有的基于这些模型的分割系统常依赖DOVER-Lap来组合来自各个通道的输出。虽然有效,但这种方法造成了相当大的计算开销,无法充分利用空间信息。本文基于DiariZen构建,组合WavLM基于局部的端到端神经分割与说话人嵌入聚类的方法,引入一种轻量级方法,使预训练的WavLM具有空间感知能力,通过在早期层中插入通道通信模块。我们的方法对麦克风通道数和阵列拓扑结构不敏感,确保了广泛的适用性。我们进一步提出通过利用空间注意力权重融合多通道说话人嵌入。评估在五个公开数据集上显示,与单通道基线一致地改进了性能,并在DOVER-Lap方面表现出卓越的性能和效率。我们的源代码已公开available at https://github.com/BUTSpeechFIT/DiariZen.

关键词

引用

@article{arxiv.2510.14551,
  title  = {Spatially Aware Self-Supervised Models for Multi-Channel Neural Speaker Diarization},
  author = {Jiangyu Han and Ruoyu Wang and Yoshiki Masuyama and Marc Delcroix and Johan Rohdin and Jun Du and Lukas Burget},
  journal= {arXiv preprint arXiv:2510.14551},
  year   = {2025}
}

备注

Submitted to ICASSP 2026