高保真神经音频压缩
音频与语音处理
2022-10-25 v1 人工智能
声音
机器学习
摘要
我们介绍了一种最先进的实时高保真神经音频编解码器。它由一个流式编码器-解码器架构组成,具有以端到端方式训练的量化潜空间。我们通过使用单一多尺度频谱图对抗器来简化并加速训练,该对抗器有效减少伪影并生成高质量样本。我们引入一种新颖的损失平衡机制以稳定训练:损失的权重现在定义其应代表的总体梯度的比例,从而将该超参数的选择与该损失的典型尺度解耦。最后,我们研究如何使用轻量级 Transformer 模型将所获表示进一步压缩多达 40%,同时保持比实时更快的速度。我们详细描述了所提模型的关键设计选择,包括:训练目标、架构更改以及各种感知损失函数的研究。我们给出了广泛的主观评价(MUSHRA 测试)以及对一系列带宽和音频域(包括语音、含噪混响语音和音乐)的消融研究。在 24 kHz 单声道和 48 kHz 立体声音频的评估设定下,我们的方法在所有评估设置中均优于基线方法。代码与模型可在 github.com/facebookresearch/encodec 获取。
引用
@article{arxiv.2210.13438,
title = {High Fidelity Neural Audio Compression},
author = {Alexandre Défossez and Jade Copet and Gabriel Synnaeve and Yossi Adi},
journal= {arXiv preprint arXiv:2210.13438},
year = {2022}
}
备注
Preprint