中文

STFTCodec:基于时频域表示的高保真音频压缩

声音 2025-03-24 v1 音频与语音处理

摘要

我们提出了 STFTCodec,这是一种基于短时傅里叶变换(STFT)的新型谱系神经音频编解码器,能够高效压缩音频信号。与基于波形的方案相遇,后者需要大量模型容量和大量内存消耗;本方法利用 STFT 实现紧凑的谱系表示,引入未包装相位导数作为辅助特征。我们的体系结构采用平行的幅度和相位处理分支,并通过高级特征提取机制进行增强。通过放宽严格的相位重构约束同时保持相位感知处理,我们实现了卓越的感知质量。实验结果表明,STFTCodec 在多个比特率下均优于基于波形和基于谱系的方案,同时通过修改 STFT 参数而无需改变网络结构,实现了独特的压缩比率灵活性调整。

关键词

引用

@article{arxiv.2503.16989,
  title  = {STFTCodec: High-Fidelity Audio Compression through Time-Frequency Domain Representation},
  author = {Tao Feng and Zhiyuan Zhao and Yifan Xie and Yuqi Ye and Xiangyang Luo and Xun Guan and Yu Li},
  journal= {arXiv preprint arXiv:2503.16989},
  year   = {2025}
}

备注

7 pages, 2 figures, accepted by ICME 2025