中文

基于说话人追踪缓冲的在线端到端神经说话人日志方法

音频与语音处理 2021-03-09 v2 声音

摘要

本文提出一种基于全监督自注意力机制(SA-EEND)的新型在线说话人日志算法。由于录音中可能存在说话人区域分配错误,在线日志 inherently 存在说话人排列问题。为规避这种不一致性,我们提出了一种说话人追踪缓冲机制,该机制从先前块中选择若干代表说话人排列信息的输入帧并存入缓冲区。这些缓冲帧与当前块中的输入帧堆叠后送入自注意力网络。我们的方法通过检查缓冲区和当前块对应输出之间的相关性,确保两者日志输出的一致性。此外,我们使用可变块大小训练 SA-EEND,以缓解说话人追踪缓冲机制引入的训练与推理之间的不匹配。实验结果(包括在线 SA-EEND 和可变块大小)在 1.4s 实际延迟下于 CALLHOME 和 CSJ 上分别取得了 12.54% 和 20.77% 的 DER。

关键词

引用

@article{arxiv.2006.02616,
  title  = {Online End-to-End Neural Diarization with Speaker-Tracing Buffer},
  author = {Yawen Xue and Shota Horiguchi and Yusuke Fujita and Shinji Watanabe and Kenji Nagamatsu},
  journal= {arXiv preprint arXiv:2006.02616},
  year   = {2021}
}

备注

Accepted to SLT 2021