基于 Conformer 架构的说话人条件化单通道目标说话人提取
音频与语音处理
2022-05-30 v1
摘要
目标说话人提取旨在利用关于目标说话人的辅助信息,从多说话人混合中萃取目标说话人。本文考虑一个完整的时域目标说话人提取系统,由说话人嵌入网络与说话人分离网络组成,二者以端到端学习方式联合训练。我们提出两种基于卷积增强变换器(conformer)的说话人分离网络架构。第一种架构使用 conformer 与外部前馈块堆叠(Conformer-FFN),第二种使用时序卷积网络(TCN)与 conformer 块堆叠(TCN-Conformer)。针对 2 说话人混合、3 说话人混合及含噪 2 说话人混合的实验结果表明,在所提分离网络中,TCN-Conformer 相比 Conformer-FFN 与基于 TCN 的基线系统显著提升了目标说话人提取性能。
引用
@article{arxiv.2205.13851,
title = {Speaker-conditioning Single-channel Target Speaker Extraction using Conformer-based Architectures},
author = {Ragini Sinha and Marvin Tammen and Christian Rollwage and Simon Doclo},
journal= {arXiv preprint arXiv:2205.13851},
year = {2022}
}
备注
submitted to IWAENC 2022