中文

基于 DNN 的 MDCT 域后滤波器以增强编码语音质量

音频与语音处理 2025-05-23 v1 机器学习 声音 信号处理

摘要

频域处理,尤其是修正离散余弦变换(Modified Discrete Cosine Transform, MDCT)的使用,是音频编码中最广泛采用的方法。然而,在低码率下,由于可直接编码变换系数的比特数不足,音频质量(尤其是语音)急剧下降。传统上,后滤波通过利用信源的先验信息与额外传输的参数来减轻编码语音中的伪影。近来,数据驱动的后滤波器展现出更优结果,但代价是显著增加的额外复杂度与延迟。本工作中,我们提出一种直接作用于编解码器 MDCT 域的基于掩码的后滤波器,不引入额外延迟。该实值掩码应用于量化后的 MDCT 系数,并由一个相对轻量的卷积编解码网络估计。我们的方案在近期标准化的低延迟低复杂度编解码器(LC3)的最低可行码率 16 kbps 下测试。客观与主观评估清晰显示了该方法相对于传统后滤波的优势,相较 LC3 编码语音平均提升 10 个 MUSHRA 点。

关键词

引用

@article{arxiv.2201.12039,
  title  = {A DNN Based Post-Filter to Enhance the Quality of Coded Speech in MDCT Domain},
  author = {Kishan Gupta and Srikanth Korse and Bernd Edler and Guillaume Fuchs},
  journal= {arXiv preprint arXiv:2201.12039},
  year   = {2025}
}