中文

提升端到端神经日记化中模拟对话的自然度

音频与语音处理 2022-04-26 v1 计算与语言 声音

摘要

本文研究了一种用于端到端神经日记化(EEND)模型训练中模拟自然对话的方法。由于缺乏带标注的真实对话数据集,EEND 通常先在大规模拟对话数据集上预训练,再适配到目标真实数据集。模拟数据集在 EEND 的训练中起着至关重要的作用,但迄今为止针对最优模拟方法的研究尚不充分。因此我们提出了一种模拟自然对话语音的方法。与简单拼接多名说话人语音的传统方法不同,我们的方法考虑了话轮转换。我们定义了四种说话人转换类型并依次排列以模拟自然对话。使用我们方法模拟的数据集在静音比和重叠比方面被发现与真实数据集具有统计相似性。基于 CALLHOME 和 CSJ 数据集的双说话人日记化实验结果表明,该模拟数据集有助于提升 EEND 的性能。

关键词

引用

@article{arxiv.2204.11232,
  title  = {Improving the Naturalness of Simulated Conversations for End-to-End Neural Diarization},
  author = {Natsuo Yamashita and Shota Horiguchi and Takeshi Homma},
  journal= {arXiv preprint arXiv:2204.11232},
  year   = {2022}
}

备注

Accepted to Speaker Odyssey 2022