面向轻量级端到端语音编码的级联跨模块残差学习
音频与语音处理
2020-08-11 v4 机器学习
声音
摘要
语音编解码器学习语音信号的紧凑表示以促进数据传输。许多近期基于深度神经网络(DNN)的端到端语音编解码器以模型复杂度为代价实现了低码率和高感知质量。我们提出了一种跨模块残差学习(CMRL)流水线作为模块载体,其中每个模块重构其前序模块的残差。CMRL不同于其他基于DNN的语音编解码器,它不是在单个大型神经网络中对语音压缩问题建模,而是在两阶段训练方案中优化一系列较简单的模块。所提方法表现出优于AMR-WB和具有相似网络架构的最先进基于DNN的语音编解码器的客观性能。作为端到端模型,它接收原始PCM信号作为输入,但也与线性预测编码(LPC)兼容,在高码率下表现出优于AMR-WB和OPUS的主观质量。该增益仅通过使用0.9百万可训练参数实现,其架构复杂度显著低于文献中其他基于DNN的编解码器。
引用
@article{arxiv.1906.07769,
title = {Cascaded Cross-Module Residual Learning towards Lightweight End-to-End Speech Coding},
author = {Kai Zhen and Jongmo Sung and Mi Suk Lee and Seungkwon Beack and Minje Kim},
journal= {arXiv preprint arXiv:1906.07769},
year = {2020}
}
备注
Accepted for publication in INTERSPEECH 2019