中文

CFMDCTCodec:基于噪声先验感知的条件流匹配 MDCT 谱增强低比特率神经语音编解码器

音频与语音处理 2026-05-27 v1

摘要

在带宽受限的应用中,实现高质量低比特率语音编码仍然具有挑战性,因为高度压缩的表示会导致关键质量信息的严重丢失。为克服这一挑战,我们提出了 CFMDCTCodec,一种在修改离散余弦变换 (MDCT) 域中完全运行的低比特率神经语音编解码器。CFMDCTCodec 将一个轻量级的编码器-量化-解码器样式 MDCT 谱编解码器与一个基于噪声先验感知的条件流匹配 (CFM) MDCT 谱增强器集成在一起。在此框架下,该编解码器作为一个基模块,对从语音中提取的 MDCT 谱进行紧凑离散化,并产生初始的粗糙重构,而增强器进一步恢复细粒度的谱细节。增强器通过整合一个条件 MDCT 速度场滤波器和一个常微分方程 (ODE) 求解器,在噪声先验的指导下改进解码的 MDCT 谱,旨在强化感知上关键的高能区域,同时稳定低能和静默区域。最后,将增强后的 MDCT 谱通过逆 MDCT 重构为解码语音。在优化 CFMDCTCodec 时,我们采用一种统一的非对抗训练策略,联合组合重建、量化和 CFM 目标。无论是客观评价还是主观评价,都表明 CFMDCTCodec 在低比特率条件下(例如 0.65 kbps)优于对手基线,同时以显著更少的参数和计算量接近大规模编解码器的感知质量。

关键词

引用

@article{arxiv.2605.26812,
  title  = {CFMDCTCodec: A Low-Bitrate Neural Speech Codec with Noise-Prior-aware Conditional Flow Matching for MDCT-Spectral Enhancement},
  author = {Xiao-Hang Jiang and Yang Ai and Hui-Peng Du and Zhen-Hua Ling and Ji Wu},
  journal= {arXiv preprint arXiv:2605.26812},
  year   = {2026}
}

备注

Accepted by IEEE Transactions on Audio, Speech and Language Processing