基于分数生成模型的视听语音增强
音频与语音处理
2023-06-05 v1 机器学习
摘要
本文介绍了一种利用基于分数的生成模型(亦称扩散模型)、以视觉信息为条件的视听语音增强系统。具体而言,我们利用从在唇读上微调的自监督学习模型获得的视听嵌入。其基于transformer的编码器的分层特征被聚合、时间对齐,并融入噪声条件分数网络(noise conditional score network)。实验评估表明,所提视听语音增强系统相较于仅音频的等价系统提升了语音质量,并减少了诸如语音混淆等生成伪影。后者由下游自动语音识别模型的词错误率佐证,该错误率显著下降,尤其在低输入信噪比时。
引用
@article{arxiv.2306.01432,
title = {Audio-Visual Speech Enhancement with Score-Based Generative Models},
author = {Julius Richter and Simone Frintrop and Timo Gerkmann},
journal= {arXiv preprint arXiv:2306.01432},
year = {2023}
}
备注
Submitted to ITG Conference on Speech Communication