中文

DIVE:基于迭代说话人嵌入的端到端语音日记化

声音 2021-05-31 v1 机器学习 音频与语音处理

摘要

我们提出 DIVE,一种端到端说话人日记化算法。我们的神经算法将日记化任务表述为迭代过程:它重复地为每个说话人构建表示,再基于所提取的表示预测各说话人的语音活动。该策略从本质上解决了说话人排序歧义,无需经典的置换不变训练损失。与先前工作不同,我们的模型不依赖预训练说话人表示,并以多说话人语音活动损失优化系统全部参数。重要的是,我们的损失显式地将不可靠的说话人切换边界排除于训练之外,这适配于基于标准 collar 的日记化错误率(DER)评估。综上,这些贡献使系统重新定义了标准 CALLHOME 基准上的最优水平,其 DER 为 6.7%,而最佳替代方案为 7.8%。

关键词

引用

@article{arxiv.2105.13802,
  title  = {DIVE: End-to-end Speech Diarization via Iterative Speaker Embedding},
  author = {Neil Zeghidour and Olivier Teboul and David Grangier},
  journal= {arXiv preprint arXiv:2105.13802},
  year   = {2021}
}