中文

仅使用纯净语音的自监督语音质量估计与增强

声音 2024-02-27 v1 人工智能 机器学习 音频与语音处理

摘要

语音质量估计最近经历了从人类听觉专家设计到机器学习模型的范式转变。然而,当前的模型主要依赖监督学习,这对于标签收集而言既耗时又昂贵。为了解决这个问题,我们提出了 VQScore,这是一种基于矢量量化变分自编码器(VQ-VAE)量化误差的自监督语音评估指标。VQ-VAE 的训练依赖于纯净语音;因此,当语音失真时,可以预期会出现较大的量化误差。为了进一步提高与真实质量分数的相关性,我们将语音处理的领域知识融入了模型设计中。我们发现矢量量化机制也可用于自监督语音增强(SE)模型的训练。为了提高编码器在 SE 中的鲁棒性,我们引入了一种结合对抗训练的新型自蒸馏机制。总之,所提出的语音质量估计方法和增强模型仅需纯净语音进行训练,无需任何标签要求。实验结果表明,所提出的 VQScore 和增强模型与监督基线相比具有竞争力。代码将在发表后发布。

关键词

引用

@article{arxiv.2402.16321,
  title  = {Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech},
  author = {Szu-Wei Fu and Kuo-Hsuan Hung and Yu Tsao and Yu-Chiang Frank Wang},
  journal= {arXiv preprint arXiv:2402.16321},
  year   = {2024}
}

备注

Published as a conference paper at ICLR 2024