透过对话看清楚:基于扩散模型的音视频语音分离
音频与语音处理
2023-10-31 v1 计算机视觉与模式识别
声音
摘要
本工作的目标是利用视觉线索从混合语音中提取目标说话人的声音。现有的音视频语音分离工作已展现出具有良好可懂度的性能,但保持自然度仍具挑战。为解决该问题,我们提出了 AVDiffuSS,一种基于扩散机制的音视频语音分离模型,该机制以生成自然样本的能力而著称。为有效融合两种模态以进行扩散,我们还提出了一种基于交叉注意力的特征融合机制。该机制专为语音领域定制,以在语音生成中整合来自音视频对应关系的语音信息。如此,融合过程保持了特征的高时间分辨率,且无过高计算需求。我们证明了所提框架在两个基准(包括 VoxCeleb2 和 LRS3)上取得了最先进的结果,生成了自然度显著更好的语音。
引用
@article{arxiv.2310.19581,
title = {Seeing Through the Conversation: Audio-Visual Speech Separation based on Diffusion Model},
author = {Suyeon Lee and Chaeyoung Jung and Youngjoon Jang and Jaehun Kim and Joon Son Chung},
journal= {arXiv preprint arXiv:2310.19581},
year = {2023}
}
备注
Project page with demo: https://mm.kaist.ac.kr/projects/avdiffuss/