中文

基于语音活动与重叠检测的端到端说话人日志化条件方法

音频与语音处理 2021-06-09 v1 声音

摘要

本文提出一种用于端到端神经说话人日志化(EEND)的条件多任务学习方法。与传统基于聚类的方法相比,EEND 系统已展现出良好性能,尤其在重叠语音情况下。本文为进一步改进 EEND 系统性能,提出一种新颖的多任务学习框架,在显式考虑任务依赖的同时求解说话人日志化及其期望子任务。基于概率链式法则,我们以作为说话人日志化子任务的语音活动与重叠检测为条件优化说话人日志化。实验结果表明,所提方法能利用子任务有效建模说话人日志化,并在日志化错误率上优于传统 EEND 系统。

关键词

引用

@article{arxiv.2106.04078,
  title  = {End-to-End Speaker Diarization Conditioned on Speech Activity and Overlap Detection},
  author = {Yuki Takashima and Yusuke Fujita and Shinji Watanabe and Shota Horiguchi and Paola García and Kenji Nagamatsu},
  journal= {arXiv preprint arXiv:2106.04078},
  year   = {2021}
}

备注

Accepted for SLT 2021