基于跨模态对应损失的视听语音分离
声音
2021-03-03 v1 机器学习
音频与语音处理
摘要
我们提出了一种视听语音分离学习方法,该方法考虑分离信号与视觉信号之间的对应关系,以在训练过程中反映语音特征。视听语音分离是一种利用说话人视觉信号从混合信号中估计个体语音信号的技术。传统的视听语音分离研究主要在仅音频损失上训练分离模型,该损失反映源信号与分离信号之间的距离。然而,传统损失未反映语音信号的特征,包括说话人特征与音素信息,从而导致失真或残留噪声。为解决此问题,我们提出了跨模态对应(CMC)损失,其基于语音信号与视觉信号的共现性。由于视觉信号不受背景噪声影响且包含说话人与音素信息,使用CMC损失可使视听语音分离模型在去除噪声的同时保留语音特征。实验结果表明,所提方法基于CMC损失学习共现性,从而提升了分离性能。
引用
@article{arxiv.2103.01463,
title = {Audio-Visual Speech Separation Using Cross-Modal Correspondence Loss},
author = {Naoki Makishima and Mana Ihori and Akihiko Takashima and Tomohiro Tanaka and Shota Orihashi and Ryo Masumura},
journal= {arXiv preprint arXiv:2103.01463},
year = {2021}
}
备注
Accepted to ICASSP 2021