基于通道去相关与目标说话人自适应的多通道目标语音提取
音频与语音处理
2020-10-23 v2
摘要
端到端的单通道目标语音提取方法已引起广泛关注。然而,针对端到端多通道目标语音提取的研究仍相对有限。在这项工作中,我们提出了两种利用多通道空间信息来提取目标语音的方法。第一种是在并行编码器架构中使用目标语音自适应层。第二种是设计一种通道去相关机制,以提取通道间差分信息来增强多通道编码器表示。我们将所提方法与两个强大的当前最优基线进行了比较。在多通道混响 WSJ0 2-mix 数据集上的实验结果表明,我们提出的方法在 SDR 和 SiSDR 上分别实现了高达 11.2% 和 11.5% 的相对提升,据我们所知,这是该任务上报道的最佳结果。
引用
@article{arxiv.2010.09191,
title = {Multi-channel target speech extraction with channel decorrelation and target speaker adaptation},
author = {Jiangyu Han and Xinyuan Zhou and Yanhua Long and Yijie Li},
journal= {arXiv preprint arXiv:2010.09191},
year = {2020}
}
备注
5 pages, 3 figures. Submitted to ICASSP 2021