基于区域提议网络的说话人日志方法
音频与语音处理
2020-02-18 v1 声音
摘要
说话人日志是许多语音应用的重要预处理步骤,旨在解决“谁在何时说话”的问题。尽管标准日志系统在各种场景下能取得令人满意的结果,但它们由若干独立优化的模块组成,且无法处理重叠语音。本文提出一种新颖的说话人日志方法:基于区域提议网络的说话人日志(RPNSD)。该方法利用神经网络生成重叠语音片段提议,同时计算其说话人嵌入。与标准日志系统相比,RPNSD具有更短的流水线,并能处理重叠语音。在三个日志数据集上的实验结果表明,RPNSD相较最先进的x-vector基线取得了显著改进。
引用
@article{arxiv.2002.06220,
title = {Speaker Diarization with Region Proposal Network},
author = {Zili Huang and Shinji Watanabe and Yusuke Fujita and Paola Garcia and Yiwen Shao and Daniel Povey and Sanjeev Khudanpur},
journal= {arXiv preprint arXiv:2002.06220},
year = {2020}
}
备注
Accepted to ICASSP 2020