从模块化到端到端的说话人语音分割
音频与语音处理
2024-07-15 v1 人工智能
声音
摘要
说话人语音分割通常指确定录音中 "谁说了什么时候" 的任务。直到几年前,所有竞争性方法都是模块化的。基于该框架构建的系统在大多数场景下达到了最佳性能,但在处理重叠语音方面存在严重困难。近期,能够以单一模型处理说话人语音分割所有方面且在重叠语音方面表现更好的端到端模型引起了高度关注。这一论文发生在这两种趋势共存的时期。我们描述了一个基于贝叶斯隐藏马尔可夫模型用于聚类x向量(由神经网络获取的说话人嵌入)的系统,称为VBx,该系统在不同数据集和挑战中显示出卓越的性能。我们评论了其优势和局限性,并在不同相关语料库上评估了结果。随后,我们转向基于端到端神经语音分割(EEND)的方法。由于训练这些模型需要大量训练数据,而缺乏足够数量的人工标注语音分割数据,折中方案是人工生成训练数据。我们描述了一种生成类似真实对话中说话人轮次和重叠的合成数据的方法。我们展示了该方法生成的 "模拟对话" 相对于之前用于创建 "模拟混合音" 的方法,能够在训练基于编码器-解码器吸引器的流行EEND模型时获得更好性能。我们还提出了一种新的EEND模型,称为DiaPer,表明它比EEND-EDA在处理大量说话人和处理重叠语音方面表现更好。最后,我们在广泛的语料库上比较了VBx和DiaPer系统,并评论了两种技术的优势。
引用
@article{arxiv.2407.08752,
title = {From Modular to End-to-End Speaker Diarization},
author = {Federico Landini},
journal= {arXiv preprint arXiv:2407.08752},
year = {2024}
}
备注
Ph.D. thesis. Successfully defended on 27.06.2024