中文

从模拟混合到模拟对话:作为端到端神经日记化训练数据的生成方法

音频与语音处理 2022-06-28 v2 声音

摘要

端到端神经日记化(EEND)如今是说话人日记化领域最突出的研究课题之一。EEND 为标准级联日记化系统提供了诱人的替代方案,因为单一系统一次性训练以处理整个日记化问题。已有若干 EEND 变体与方案被提出,然而所有这些模型都需要大量标注数据用于训练,而可用的标注数据稀缺。因此,EEND 工作大多使用模拟混合作为训练数据。但模拟混合在许多方面不像真实对话。本文中我们提出一种替代方法,利用从真实对话中估计的停顿与重叠分布统计来创建类似真实对话的合成对话。此外,我们分析了统计来源、不同增强方式与数据量的影响。我们证明我们的方法比原始方法表现大幅更优,同时降低了对微调阶段的依赖。实验在 Callhome 与 DIHARD 3 的双人电话对话上进行。随本发表,我们开源了 EEND 的实现与创建模拟对话的方法。

关键词

引用

@article{arxiv.2204.00890,
  title  = {From Simulated Mixtures to Simulated Conversations as Training Data for End-to-End Neural Diarization},
  author = {Federico Landini and Alicia Lozano-Diez and Mireia Diez and Lukáš Burget},
  journal= {arXiv preprint arXiv:2204.00890},
  year   = {2022}
}

备注

Accepted at Interspeech 2022