中文

利用说话人库存与估计语音进行说话人分离

声音 2020-10-22 v1 计算与语言 音频与语音处理

摘要

我们提出利用说话人库存与估计语音进行说话人分离(SSUSIES),这是一个利用说话人档案和估计语音进行说话人分离的框架。SSUSIES 包含两种方法:利用说话人库存的说话人分离(SSUSI)和利用估计语音的说话人分离(SSUES)。SSUSI 在说话人库存的辅助下进行说话人分离。通过结合置换不变训练(PIT)和语音提取的优势,SSUSI 显著优于传统方法。SSUES 是一种广泛适用的技术,可利用首次分离的输出大幅提升说话人分离性能。我们在说话人分离和语音识别指标上评估了这些模型。

关键词

引用

@article{arxiv.2010.10556,
  title  = {Speaker Separation Using Speaker Inventories and Estimated Speech},
  author = {Peidong Wang and Zhuo Chen and DeLiang Wang and Jinyu Li and Yifan Gong},
  journal= {arXiv preprint arXiv:2010.10556},
  year   = {2020}
}