L-SpEx:基于纯语音线索的局部化目标说话人提取
音频与语音处理
2022-02-22 v1 声音
摘要
说话人提取旨在给定辅助参考语音的条件下,从多人混合语音中提取目标说话人的声音。近期研究表明,说话人提取可从目标说话人的位置或方向中获益。然而,这些研究假设目标说话人的位置是预先已知的,或通过一个额外的视觉线索(例如人脸图像或视频)检测得到。本文提出一种基于纯语音线索的端到端局部化目标说话人提取方法,称为 L-SpEx。具体而言,我们设计了一个由目标说话人嵌入驱动的说话人定位器,以提取空间特征,包括目标说话人的到达方向(DOA)与波束成形输出。随后,空间线索与目标说话人嵌入共同用于形成对目标说话人的自顶向下听觉注意力。在名为 MC-Libri2Mix 的多通道混响数据集上的实验表明,我们的 L-SpEx 方法显著优于基线系统。
引用
@article{arxiv.2202.09995,
title = {L-SpEx: Localized Target Speaker Extraction},
author = {Meng Ge and Chenglin Xu and Longbiao Wang and Eng Siong Chng and Jianwu Dang and Haizhou Li},
journal= {arXiv preprint arXiv:2202.09995},
year = {2022}
}
备注
Accepted in ICASSP 2022