中文

PostGAN:一种基于 GAN 的后处理器以提升编码语音质量

音频与语音处理 2022-02-01 v1 声音

摘要

经变换编码的语音质量受各类伪影影响,尤其在量化频率分量所需比特率过低时。为减轻这些编码伪影并提升编码语音质量,传统上在解码端采用依赖编码器传来的先验信息的后处理器。近年来,若干数据驱动的后处理器被提出,并被证明优于传统方法。本文中,我们提出 PostGAN,一种基于 GAN 的神经后处理器,它在子带域中运行,并依赖 U-Net 架构与一种学习到的仿射变换。它已在近期标准化的低复杂度、低延迟蓝牙编解码器(LC3)的最低比特率(16 kbit/s)宽带语音上测试。主观评价与客观得分表明,该新引入的后处理器超越了已发表的方法,并能将编码语音质量提升约 20 个 MUSHRA 点。

关键词

引用

@article{arxiv.2201.13093,
  title  = {PostGAN: A GAN-Based Post-Processor to Enhance the Quality of Coded Speech},
  author = {Srikanth Korse and Nicola Pia and Kishan Gupta and Guillaume Fuchs},
  journal= {arXiv preprint arXiv:2201.13093},
  year   = {2022}
}

备注

Accepted to ICASSP 2022