中文

基于改进I-Vector估计的未知说话人数量目标说话人语音活动检测

音频与语音处理 2021-08-10 v1

摘要

目标说话人语音活动检测(TS-VAD)近期在高度重叠语音的说话人日志化任务中展现出有前景的结果。然而,原始模型要求固定(且已知)的说话人数量,这限制了其在真实对话中的应用。本文中将TS-VAD扩展至未知说话人数量的说话人日志化。这通过两步实现:首先应用初始日志化系统估计说话人数量,随后根据该估计对TS-VAD网络输出进行掩码。我们进一步研究了不同的日志化方法,包括基于聚类和区域提议网络,用于估计初始i-vector。由于这些系统具有互补优势,我们提出了一种基于融合的方法,将各系统的帧级决策进行组合以获得改进的初始化。通过在LibriCSS会议语料库变体上的实验表明,我们所提方法在不同说话人数量下可将DER相对改善至多50%。该改善也带来了更好的下游ASR性能,接近使用神谕(oracle)分段时的表现。

关键词

引用

@article{arxiv.2108.03342,
  title  = {Target-speaker Voice Activity Detection with Improved I-Vector Estimation for Unknown Number of Speaker},
  author = {Maokui He and Desh Raj and Zili Huang and Jun Du and Zhuo Chen and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2108.03342},
  year   = {2021}
}