基于MDCTNet的高质量音频编码
音频与语音处理
2022-12-12 v1 声音
摘要
我们提出一种神经音频生成模型MDCTNet,其运行于自适应改进离散余弦变换(MDCT)的感知加权域。该模型架构通过循环层(RNNs)捕捉时间与频率两个方向上的相关性。通过在48 kHz采样的多样化全频带单声道音频信号上以感知音频编码器为条件训练MDCTNet,获得了一个音频编码系统。在一项主观听音测试中,选取十段在内容类型上均衡却对两类编解码器均具压力的内容片段,所提系统在24 kb/s可变码率(VBR)下的平均表现与码率加倍时的Opus相当。
引用
@article{arxiv.2212.04583,
title = {High Quality Audio Coding with MDCTNet},
author = {Grant Davidson and Mark Vinton and Per Ekstrand and Cong Zhou and Lars Villemoes and Lie Lu},
journal= {arXiv preprint arXiv:2212.04583},
year = {2022}
}
备注
Five pages, five figures