中文

TMGAN-PLC:基于时序记忆生成对抗网络的音频丢包 concealment

声音 2022-07-05 v1 音频与语音处理

摘要

分组交换网络中的实时通信已在日常通信中被广泛使用,但在受限的实时条件下不可避免地面临网络延迟与数据丢失问题。为解决这些问题,音频丢包 concealment(PLC)算法通过重建丢失信息来缓解语音传输故障。受传输延迟与设备内存限制,PLC 利用较小的包缓冲区完成高质量语音重建仍十分困难。本文提出一种用于音频 PLC 的时序记忆生成对抗网络,称为 TMGAN-PLC,其由新颖的嵌套 UNet 生成器与时域/频域判别器组成。具体而言,生成器中精心设计了嵌套 UNet 与时序特征逐线性调制(temporal feature-wise linear modulation)的组合,以精细调整帧内信息并建立帧间时序依赖。为补全较长丢包突发造成的语音内容缺失,我们采用多级门控矢量量化器来捕获正确内容并重建近真实的平滑音频。在 PLC Challenge 数据集上的大量实验表明,所提方法在语音质量、可懂度与 PLCMOS 方面均取得令人满意的性能。

关键词

引用

@article{arxiv.2207.01255,
  title  = {TMGAN-PLC: Audio Packet Loss Concealment using Temporal Memory Generative Adversarial Network},
  author = {Yuansheng Guan and Guochen Yu and Andong Li and Chengshi Zheng and Jie Wang},
  journal= {arXiv preprint arXiv:2207.01255},
  year   = {2022}
}

备注

accepted by INTERSPEECH 2022