中文

用于儿童语音日记化的说话人类型混合PLDA模型

音频与语音处理 2020-09-01 v1

摘要

在日记化中,PLDA通常用于建模一种推断结构,其假设语音片段中的变化由不同说话人引起。随后从训练数据中学习说话人变化。然而,人类感知可通过年龄、性别及其他特征区分说话人。本文中,我们研究一种说话人类型知情模型,其显式捕获说话人的已知变化。我们探索三种PLDA模型的混合,其中每个模型代表成年女性、男性或儿童类别。每个模型的权重由其各自类别的先验概率决定,我们对此进行了研究。评估在BabyTrain语料库的一个子集上执行。我们使用神谕说话人类型标签检验预期性能增益,其带来11.7%的DER降低。我们引入一种新颖的婴儿发声增强技术,然后将混合模型与单一模型比较。我们的实验结果显示通过添加发声获得了有效的0.9% DER降低。我们通过经验发现平衡数据集对训练混合PLDA模型十分重要,其在相同训练数据下以35.8%的DER优于单一PLDA达1.3%。相同设置相较标准基线改善了2.8% DER。

关键词

引用

@article{arxiv.2008.13213,
  title  = {Mixture of Speaker-type PLDAs for Children's Speech Diarization},
  author = {Jiamin Xie and Suzanna Sia and Paola Garcia and Daniel Povey and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:2008.13213},
  year   = {2020}
}

备注

submitted to Interspeech 2020