带注意力的半监督时域目标说话人提取
音频与语音处理
2022-06-22 v1 声音
摘要
在这项工作中,我们提出了Exformer,一种用于目标说话人提取的时域架构。它由一个预训练的说话人嵌入网络和一个基于Transformer编码器块的分离网络组成。我们研究了多种将说话人信息与输入混合信号相结合的方法,由此产生的Exformer架构与先前的时域网络相比,获得了优越的提取性能。此外,我们研究了一种两阶段过程,在预训练的监督模型基础上,使用无参考信号的混合信号来训练模型。实验结果表明,所提出的半监督学习过程提高了监督基线的性能。
引用
@article{arxiv.2206.09072,
title = {Semi-supervised Time Domain Target Speaker Extraction with Attention},
author = {Zhepei Wang and Ritwik Giri and Shrikant Venkataramani and Umut Isik and Jean-Marc Valin and Paris Smaragdis and Mike Goodwin and Arvindh Krishnaswamy},
journal= {arXiv preprint arXiv:2206.09072},
year = {2022}
}