WARP-Q:面向生成式神经语音编解码器的质量预测
音频与语音处理
2021-02-23 v1 信号处理
摘要
使用波形匹配和参数化重建编码器已实现良好的语音质量。近期开发的极低码率生成式编解码器能够以低于 3 kb/s 的码流重建高质量宽带语音。这些编解码器利用带有参数化输入的 DNN 合成高质量语音输出。现有的客观语音质量模型(如 POLQA、ViSQOL)无法准确预测这些生成式模型编码语音的质量,由于主观试听中未凸显的信号差异而低估了质量。我们提出 WARP-Q,一种使用 MFCC 语音表示的动态时间规整代价的全参考客观语音质量度量。它对微小的感知信号变化具有鲁棒性。使用波形匹配、参数化和基于生成式神经声码器的编解码器以及信道和环境噪声进行的评估表明,与传统度量相比,WARP-Q 对新型编解码器具有更好的相关性和编解码器质量排序,此外还可通用于一般质量评估场景。
引用
@article{arxiv.2102.10449,
title = {WARP-Q: Quality Prediction For Generative Neural Speech Codecs},
author = {Wissam A. Jassim and Jan Skoglund and Michael Chinen and Andrew Hines},
journal= {arXiv preprint arXiv:2102.10449},
year = {2021}
}
备注
Accepted for presentation at IEEE ICASSP 2021. Source code and data can be found on https://github.com/wjassim/WARP-Q.git