Stereo InSE-NET:从单声道 InSE-NET 迁移学习的立体声音频质量预测器
音频与语音处理
2022-09-26 v1 信号处理
摘要
自动编码音频质量预测器通常设计用于评估单声道而不考虑任何空间方面。借助 InSE-NET [1],我们展示了用深度神经网络(DNN)模仿最先进的编码音频质量度量(ViSQOL-v3 [2]),并随后完全利用程序生成的数据对其改进。本研究中,我们迈向构建基于 DNN 的编码立体声音频质量预测器,并提出一种处理立体声信号的 InSE-NET 扩展。该设计通过以左、右、中、侧声道调节模型来考虑立体声/空间方面;我们将模型命名为 Stereo InSE-NET。通过从预训练的单声道 InSE-NET 迁移选定权重,并用真实与合成增强的听音测试重新训练,我们展示相较最新 ViSQOL-v3 [3],Pearson 与 Spearman 秩相关系数分别显著提升了 12% 和 6%。
引用
@article{arxiv.2209.11666,
title = {Stereo InSE-NET: Stereo Audio Quality Predictor Transfer Learned from Mono InSE-NET},
author = {Arijit Biswas and Guanxin Jiang},
journal= {arXiv preprint arXiv:2209.11666},
year = {2022}
}
备注
Accepted to 153rd Audio Engineering Society (AES), New York, NY, USA, October 2022