利用自监督学习进行说话人日志化
音频与语音处理
2024-10-22 v3 声音
摘要
端到端神经说话人日志化在过去几年中取得了显著发展,但数据稀缺仍然是进一步改进的主要障碍。诸如WavLM之类的自监督学习方法在多个下游任务上表现出了良好的性能,但它们在说话人日志化中的应用却有限。在这项工作中,我们探索使用WavLM来缓解神经说话人日志化训练中的数据稀缺问题。我们使用与Pyannote相同的流水线,并通过WavLM和Conformer改进了局部端到端神经说话人日志化。在远场AMI、AISHELL-4和AliMeeting数据集上的实验表明,我们的方法显著优于Pyannote基线,并分别在AMI和AISHELL-4上取得了新的最先进结果。此外,通过分析不同数据量场景下的系统性能,我们表明WavLM表示比滤波器组特征对数据稀缺的鲁棒性更强,从而实现了对数据需求更低的训练策略。此外,我们发现,在我们的实验中,通常用于训练端到端说话人日志化模型的模拟数据在使用WavLM时并无帮助。另外,我们还在最近的CHiME8 NOTSOFAR-1任务上评估了我们的模型,其性能优于Pyannote基线。我们的源代码公开于https://github.com/BUTSpeechFIT/DiariZen。
引用
@article{arxiv.2409.09408,
title = {Leveraging Self-Supervised Learning for Speaker Diarization},
author = {Jiangyu Han and Federico Landini and Johan Rohdin and Anna Silnova and Mireia Diez and Lukas Burget},
journal= {arXiv preprint arXiv:2409.09408},
year = {2024}
}
备注
Submitted to ICASSP 2025; New results are updated but conclusions are exactly the same as the original one