中文

利用异构训练批次组装生成说话人表征

声音 2022-04-01 v1 人工智能 计算与语言 机器学习 多媒体 音频与语音处理

摘要

在传统的说话人日志(speaker diarization)系统中,训练良好的说话人模型是从长语音会话中连续且部分重叠的片段提取表征的关键组件。为了与后端分割和聚类更加一致,我们提出了一种基于CNN的新说话人建模方案,该方案考虑了每个训练片段和批次中说话人的异构性。我们随机且合成地将训练数据增强为一组片段,每个片段包含多于一个说话人以及一些重叠部分。基于每个片段的说话人占用比对其施加软标签,并在模型训练中采用标准交叉熵损失。通过这种方式,说话人模型应具备为每个多说话人片段生成几何上有意义的嵌入的能力。实验结果表明,我们的系统在两项说话人日志任务中优于使用x-vectors的基线系统。在基于NIST SRE和Switchboard数据集训练的CALLHOME任务中,我们的系统在DER上实现了12.93%的相对降低。在CHiME-6的Track 2中,我们的系统在DER、JER和WER上分别提供了13.24%、12.60%和5.65%的相对降低。

关键词

引用

@article{arxiv.2203.16646,
  title  = {Generation of Speaker Representations Using Heterogeneous Training Batch Assembly},
  author = {Yu-Huai Peng and Hung-Shin Lee and Pin-Tuan Huang and Hsin-Min Wang},
  journal= {arXiv preprint arXiv:2203.16646},
  year   = {2022}
}

备注

Published in APSIPA ASC 2021