InSE-NET:一种基于CNN的感知编码音频质量模型
音频与语音处理
2021-08-31 v1
摘要
自动编码音频质量评估是一项重要任务,其进展受限于人类标注的稀缺、对未知编解码器/码率/内容类型泛化能力差,以及现有方法缺乏灵活性。典型的人类感知相关指标ViSQOL v3 (ViV3)已被证明与人类评分的质量分数高度相关。本研究中,我们采取步骤解决预测编码音频质量的问题,通过充分利用以专家领域知识为指导、程序化生成的数据。我们提出了一种可学习的神经网络InSE-NET,以Inception与Squeeze-and-Excitation模块为骨干,用于评估48kHz采样率下编码音频的感知质量。我们证明了合成数据增强能够提升预测能力。我们提出的方法为有侵入式,即需要未编码参考信号的Gammatone谱图。除与ViV3相当的性能外,我们的方法对更高码率提供了更鲁棒的预测。
引用
@article{arxiv.2108.13087,
title = {InSE-NET: A Perceptually Coded Audio Quality Model based on CNN},
author = {Guanxin Jiang and Arijit Biswas and Christian Bergler and Andreas Maier},
journal= {arXiv preprint arXiv:2108.13087},
year = {2021}
}
备注
Accepted to 151st Audio Engineering Society (AES), Las Vegas, NV, USA, October 2021