基于编码器-解码器吸引子的未知说话人数量端到端说话人日志
音频与语音处理
2020-10-06 v3 计算与语言
声音
摘要
本文研究未知说话人数量的端到端说话人日志问题。近期提出的端到端说话人日志优于传统的基于聚类的说话人日志,但存在一个缺陷:其在说话人数量上灵活性较差。本文提出一种基于编码器-解码器吸引子计算(EDA)的方法,其首先从语音嵌入序列生成灵活数量的吸引子。随后,生成的多个吸引子与语音嵌入序列相乘,产生相同数量的说话人活动。语音嵌入序列使用传统的自注意力端到端神经说话人日志(SA-EEND)网络提取。在两说话人条件下,我们的方法在模拟混合上取得了 2.69% 的日志错误率(DER),在 CALLHOME 两说话人子集上取得了 8.07% 的 DER,而原始 SA-EEND 分别为 4.56% 和 9.54%。在未知说话人数量条件下,我们的方法在 CALLHOME 上取得了 15.29% 的 DER,而基于 x-vector 的聚类方法取得了 19.43% 的 DER。
引用
@article{arxiv.2005.09921,
title = {End-to-End Speaker Diarization for an Unknown Number of Speakers with Encoder-Decoder Based Attractors},
author = {Shota Horiguchi and Yusuke Fujita and Shinji Watanabe and Yawen Xue and Kenji Nagamatsu},
journal= {arXiv preprint arXiv:2005.09921},
year = {2020}
}
备注
Accepted to INTERSPEECH 2020