面向高效端到端神经音频编码的损失函数心理声学校准
声音
2021-01-05 v1 机器学习
音频与语音处理
摘要
传统音频编码技术通常利用人类对声音的感知(即心理声学)来降低码率,同时保持解码音频信号的感知质量。然而,对于神经音频编解码器而言,损失函数的客观性质通常会导致声音质量次优,并且由于模型规模庞大而带来较高的运行复杂度。在本工作中,我们提出一种心理声学校准方案,重新定义神经音频编码系统的损失函数,使其解码出的信号在感知上更接近于参考信号,同时大幅降低模型复杂度。所提出的损失函数引入了全局掩蔽阈值,从而允许对应于不可听伪影的重建误差。实验结果表明,所提模型优于规模为其两倍的基线神经编解码器,且每秒少消耗 23.4% 的比特数。借助所提方法,一个仅含 0.9 百万参数的轻量级神经编解码器实现了接近透明的音频编码,在 112 kbps 下可与商业 MPEG-1 Audio Layer III 编解码器相媲美。
引用
@article{arxiv.2101.00054,
title = {Psychoacoustic Calibration of Loss Functions for Efficient End-to-End Neural Audio Coding},
author = {Kai Zhen and Mi Suk Lee and Jongmo Sung and Seungkwon Beack and Minje Kim},
journal= {arXiv preprint arXiv:2101.00054},
year = {2021}
}