基于注意力的缩放自适应用于目标语音提取
音频与语音处理
2021-10-20 v3 声音
摘要
目标语音提取近年来受到广泛关注。在本工作中,我们重点研究不同混合语音与目标说话人之间的动态交互,以利用具有判别性的目标说话人线索。我们在缩放自适应层中提出一种不引入任何额外参数的特殊注意力机制,以更好地使网络适应于提取目标语音。此外,通过引入混合嵌入矩阵池化方法,我们所提出的基于注意力的缩放自适应(ASA)能够以一种更高效的方式利用目标说话人线索。在空间化混响 WSJ0 2-mix 数据集上的实验结果表明,所提方法能有效提升目标语音提取的性能。进一步,我们发现,在相同网络配置下,单通道条件下的 ASA 可取得与利用双通道混合语音及麦克风间相位差(IPD)特征相当的性能增益。
关键词
引用
@article{arxiv.2010.10923,
title = {Attention-based scaling adaptation for target speech extraction},
author = {Jiangyu Han and Wei Rao and Yanhua Long and Jiaen Liang},
journal= {arXiv preprint arXiv:2010.10923},
year = {2021}
}
备注
5 pages, 2 figures. Accepted by ASRU 2021