中文

PSCodec: 利用提示编码器的一系列高保真低比特率神经语音编解码器

声音 2024-11-22 v3 人工智能

摘要

神经语音编解码器近来已成为语音压缩和生成领域的焦点。尽管取得了进展,但在低比特率场景下实现高质量语音重建仍然是一个重大挑战。本文提出PSCodec,一系列基于提示编码器的神经语音编解码器,包括PSCodec-Base、PSCodec-DRL-ICT和PSCodec-CasAN,能够在低带宽下实现高性能语音重建。具体而言,我们首先引入PSCodec-Base,它利用基于预训练说话人验证模型的提示编码器(VPP-Enc)和基于可学习梅尔频谱图的提示编码器(MelP-Enc),有效解耦并整合语音中的声纹和梅尔相关特征。为了进一步提高特征利用效率,我们提出PSCodec-DRL-ICT,引入了基于结构相似性(SSIM)的解耦表示损失(DRL)和增量连续训练(ICT)策略。虽然PSCodec-DRL-ICT表现出色,但其对大量超参数调优和多阶段训练的依赖使其有些耗费人力。为规避这些限制,我们提出PSCodec-CasAN,利用先进的级联注意力网络(CasAN)增强整个系统的表示能力。大量实验表明,我们提出的PSCodec-Base、PSCodec-DRL-ICT和PSCodec-CasAN均显著优于多个最先进的神经编解码器,在低比特率条件下语音重建质量和说话人相似性方面均表现出实质性改进。

关键词

引用

@article{arxiv.2404.02702,
  title  = {PSCodec: A Series of High-Fidelity Low-bitrate Neural Speech Codecs Leveraging Prompt Encoders},
  author = {Yu Pan and Xiang Zhang and Yuguang Yang and Jixun Yao and Yanni Hu and Jianhao Ye and Hongbin Zhou and Lei Ma and Jianjun Zhao},
  journal= {arXiv preprint arXiv:2404.02702},
  year   = {2024}
}

备注

Submiited to TASLP