基于深度学习的时域尺度修正音频单端客观质量测度
音频与语音处理
2020-09-09 v1 声音
信号处理
摘要
经过时域尺度修正(Time-Scale Modification, TSM)处理的音频的客观评估正重新引起关注。最近,一个带标签的时域尺度音频数据集被用于训练一种用于 TSM 评估的客观测度。该 DE 测度是音频质量感知评估(Perceptual Evaluation of Audio Quality)的扩展,且需要参考信号和测试信号。本文提出两种不需要参考信号的时域尺度音频单端客观质量测度。数据驱动特征由卷积神经网络(CNN)或双向门控循环单元(BGRU)网络生成,并输入全连接网络以预测主观平均意见得分。所提出的 CNN 和 BGRU 测度分别取得了 0.608 和 0.576 的平均均方根误差,以及 0.771 和 0.794 的平均皮尔逊相关系数。所提出的测度被用于评估 TSM 算法,并给出了 16 种 TSM 实现的比较。该客观测度可在 https://www.github.com/zygurt/TSM 获取。
引用
@article{arxiv.2009.02940,
title = {Deep Learning-Based Single-Ended Objective Quality Measures for Time-Scale Modified Audio},
author = {Timothy Roberts and Aaron Nicolson and Kuldip K. Paliwal},
journal= {arXiv preprint arXiv:2009.02940},
year = {2020}
}
备注
13 pages, 11 figures, Submitted to The Journal of the Acoustical Society of America