MC-SpEx:面向高效说话人提取的多尺度交互融合与条件说话人调制
声音
2023-06-29 v1 音频与语音处理
摘要
此前的 SpEx+ 在说话人提取中取得了优异性能并引起广泛关注。然而,它仍存在多尺度信息与说话人嵌入利用不足的问题。为此,本文提出一种具有多尺度交互融合与条件说话人调制(ConSM)的新颖高效说话人提取系统,称为 MC-SpEx。首先,我们设计权值共享的多尺度融合器(ScaleFusers)以高效利用多尺度信息并保证模型特征空间的一致性。然后,为在生成掩码时兼顾不同尺度信息,提出多尺度交互掩码生成器(ScaleInterMG)。此外,我们引入 ConSM 模块以在语音提取器中充分利用说话人嵌入。在 Libri2Mix 数据集上的实验结果证明了我们所做改进的有效性以及所提 MC-SpEx 的最先进性能。
引用
@article{arxiv.2306.16250,
title = {MC-SpEx: Towards Effective Speaker Extraction with Multi-Scale Interfusion and Conditional Speaker Modulation},
author = {Jun Chen and Wei Rao and Zilin Wang and Jiuxin Lin and Yukai Ju and Shulin He and Yannan Wang and Zhiyong Wu},
journal= {arXiv preprint arXiv:2306.16250},
year = {2023}
}
备注
Accepted by InterSpeech 2023