USEV:基于视觉线索的通用说话人提取
音频与语音处理
2022-09-01 v2 声音
摘要
说话人提取算法旨在从多说话人语音混合中提取目标说话人的语音。先前的研究大多聚焦于从高度重叠的多说话人语音混合中提取说话人。然而,在自然语音交流中,目标与干扰说话人的重叠比例可能在0%到100%的宽范围内变化,且目标说话人可能不在语音混合中,此类通用多说话人场景中的语音混合被称为一般语音混合。说话人提取算法需要辅助参考,例如视频录制或预录语音,以形成对目标说话人的自上而下听觉注意。我们主张,在从一般语音混合中分离目标说话人时,视觉线索(即唇部运动)比音频线索(即预录语音)更具信息量,更适合作为说话人提取的辅助参考。在本文中,我们提出了一种带视觉线索的通用说话人提取网络,可适用于所有多说话人场景。此外,我们提出了一种场景感知的差异化损失函数用于网络训练,以平衡网络在不同目标-干扰说话人配对场景下的性能。实验结果表明,在信号保真度方面,我们所提方法优于针对一般语音混合的多种竞争性基线。
引用
@article{arxiv.2109.14831,
title = {USEV: Universal Speaker Extraction with Visual Cue},
author = {Zexu Pan and Meng Ge and Haizhou Li},
journal= {arXiv preprint arXiv:2109.14831},
year = {2022}
}
备注
Accepted by TASLP