中文

用于客观感知音频质量评估的数据驱动认知显著度模型

音频与语音处理 2022-12-12 v1 声音 信号处理

摘要

客观音频质量测量系统通常使用感知模型来预测听音测试中报告的 processed 信号的主观质量分数。大多数系统将不同的感知退化度量映射为预测主观质量的单一质量分数。这需要一个质量映射阶段,该阶段以失真度量作为输入特征,利用真实听音测试数据通过统计学习(即数据驱动方法)进行推断。然而,实践中可靠训练数据的数量有限,通常不足以对大型学习模型进行全面训练。客观系统中的认知效应模型可改进学习模型。具体而言,考虑到某些失真类型的显著度,它们为映射阶段提供额外特征,从而改进学习过程,尤其在训练数据量有限时。我们提出了一种新颖的数据驱动显著度模型,该模型通过利用显著度度量显式估计认知/退化度量交互来指导质量映射阶段。结果表明,对于具有代表性的验证数据集,集成了该新颖显著度模型的系统在性能上优于仅使用统计学习来结合认知与退化度量的等效系统,以及其他知名测量系统。

关键词

引用

@article{arxiv.2212.04572,
  title  = {A Data-driven Cognitive Salience Model for Objective Perceptual Audio Quality Assessment},
  author = {Pablo M. Delgado and Jürgen Herre},
  journal= {arXiv preprint arXiv:2212.04572},
  year   = {2022}
}

备注

Accepted version of the paper submitted to ICASSP 2020