中文

基于分数生成模型的视听语音增强

音频与语音处理 2023-06-05 v1 机器学习

摘要

本文介绍了一种利用基于分数的生成模型(亦称扩散模型)、以视觉信息为条件的视听语音增强系统。具体而言,我们利用从在唇读上微调的自监督学习模型获得的视听嵌入。其基于transformer的编码器的分层特征被聚合、时间对齐,并融入噪声条件分数网络(noise conditional score network)。实验评估表明,所提视听语音增强系统相较于仅音频的等价系统提升了语音质量,并减少了诸如语音混淆等生成伪影。后者由下游自动语音识别模型的词错误率佐证,该错误率显著下降,尤其在低输入信噪比时。

关键词

引用

@article{arxiv.2306.01432,
  title  = {Audio-Visual Speech Enhancement with Score-Based Generative Models},
  author = {Julius Richter and Simone Frintrop and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2306.01432},
  year   = {2023}
}

备注

Submitted to ITG Conference on Speech Communication