中文

基于伪标签的端到端神经日记化半监督训练

音频与语音处理 2021-06-10 v1 声音

摘要

本文提出一种用于端到端神经日记化(EEND)的基于伪标签的半监督训练技术。与传统基于聚类的方法相比,EEND系统展现出有前景的性能,尤其在重叠语音情形下。然而,为获得良好调优的模型,EEND需要录音中每一时刻帧每位说话人所有联合语音活动的标注数据。本文探索一种利用无标注数据的伪标签方法。首先,我们提出一种针对EEND的迭代伪标签方法,其使用目标条件的无标注数据训练模型。此外,我们还提出一种基于委员会的训练方法以提升EEND性能。为评估所提方法,我们利用有标注与无标注数据进行模型自适应实验。在CALLHOME数据集上的实验结果表明,相较于种子模型,所提伪标签实现了37.4%的相对日记化错误率下降。此外,我们分析了基于伪标签的半监督自适应结果。我们也展示了该方法在第三个DIHARD数据集上的有效性。

关键词

引用

@article{arxiv.2106.04764,
  title  = {Semi-Supervised Training with Pseudo-Labeling for End-to-End Neural Diarization},
  author = {Yuki Takashima and Yusuke Fujita and Shota Horiguchi and Shinji Watanabe and Paola García and Kenji Nagamatsu},
  journal= {arXiv preprint arXiv:2106.04764},
  year   = {2021}
}

备注

Accepted for Interspeech 2021