Muse:利用视觉线索的多模态目标说话人提取
音频与语音处理
2021-02-11 v3 多媒体
声音
图像与视频处理
摘要
说话人提取算法依赖目标说话人的语音样本作为参考点来聚焦其注意力。此类参考语音通常为预录制。另一方面,语音与唇部运动的时间同步也作为一种信息性线索。受此启发,我们研究一种新技术,利用语音-唇部视觉线索在推理时直接从混合语音中提取参考目标语音,无需预录制参考语音。我们提出一个名为MuSE的多模态说话人提取网络,其仅以唇部图像序列为条件。MuSE不仅在SI-SDR和PESQ方面优于其他竞争性基线,而且在跨数据集评估中表现出一致的提升。
引用
@article{arxiv.2010.07775,
title = {Muse: Multi-modal target speaker extraction with visual cues},
author = {Zexu Pan and Ruijie Tao and Chenglin Xu and Haizhou Li},
journal= {arXiv preprint arXiv:2010.07775},
year = {2021}
}
备注
Accepted by ICASSP2021