中文

带注意力的半监督时域目标说话人提取

音频与语音处理 2022-06-22 v1 声音

摘要

在这项工作中,我们提出了Exformer,一种用于目标说话人提取的时域架构。它由一个预训练的说话人嵌入网络和一个基于Transformer编码器块的分离网络组成。我们研究了多种将说话人信息与输入混合信号相结合的方法,由此产生的Exformer架构与先前的时域网络相比,获得了优越的提取性能。此外,我们研究了一种两阶段过程,在预训练的监督模型基础上,使用无参考信号的混合信号来训练模型。实验结果表明,所提出的半监督学习过程提高了监督基线的性能。

关键词

引用

@article{arxiv.2206.09072,
  title  = {Semi-supervised Time Domain Target Speaker Extraction with Attention},
  author = {Zhepei Wang and Ritwik Giri and Shrikant Venkataramani and Umut Isik and Jean-Marc Valin and Paris Smaragdis and Mike Goodwin and Arvindh Krishnaswamy},
  journal= {arXiv preprint arXiv:2206.09072},
  year   = {2022}
}