LACE:一种通过自适应卷积增强编码语音的轻量级因果模型
音频与语音处理
2023-07-14 v1
摘要
经典语音编码采用零前瞻的低复杂度后滤波器来增强编码语音的质量,但其效果受限于自身的简单性。深度神经网络(DNNs)可以更为有效,但需要较高的复杂度和模型规模,或带来额外延迟。我们提出了一种 DNN 模型,它以逐帧方式生成经典滤波器核,模型仅有 300~K 参数和 100~MFLOPS 复杂度,这对于桌面或移动设备 CPU 而言是实用的复杂度。无额外延迟的特性使其能够被集成到 Opus 编解码器中,并且我们证明它能够在低至 6 kb/s 的比特率下实现有效的宽带编码。
引用
@article{arxiv.2307.06610,
title = {LACE: A light-weight, causal model for enhancing coded speech through adaptive convolutions},
author = {Jan Büthe and Jean-Marc Valin and Ahmed Mustafa},
journal= {arXiv preprint arXiv:2307.06610},
year = {2023}
}
备注
5 pages, accepted at WASPAA 2023