中文

基于 Conformer 架构的说话人条件化单通道目标说话人提取

音频与语音处理 2022-05-30 v1

摘要

目标说话人提取旨在利用关于目标说话人的辅助信息,从多说话人混合中萃取目标说话人。本文考虑一个完整的时域目标说话人提取系统,由说话人嵌入网络与说话人分离网络组成,二者以端到端学习方式联合训练。我们提出两种基于卷积增强变换器(conformer)的说话人分离网络架构。第一种架构使用 conformer 与外部前馈块堆叠(Conformer-FFN),第二种使用时序卷积网络(TCN)与 conformer 块堆叠(TCN-Conformer)。针对 2 说话人混合、3 说话人混合及含噪 2 说话人混合的实验结果表明,在所提分离网络中,TCN-Conformer 相比 Conformer-FFN 与基于 TCN 的基线系统显著提升了目标说话人提取性能。

关键词

引用

@article{arxiv.2205.13851,
  title  = {Speaker-conditioning Single-channel Target Speaker Extraction using Conformer-based Architectures},
  author = {Ragini Sinha and Marvin Tammen and Christian Rollwage and Simon Doclo},
  journal= {arXiv preprint arXiv:2205.13851},
  year   = {2022}
}

备注

submitted to IWAENC 2022