CORN:全参考与无参考语音质量评估的联合训练框架
音频与语音处理
2024-01-10 v2 机器学习
声音
摘要
感知评估是各类音频处理任务中的关键环节。全参考(FR)或基于相似度的指标依赖于高质量参考录音,可将录音的较低质量或受损版本与之比较以进行评估。相比之下,无参考(NR)指标在不依赖参考的情况下对录音进行评估。FR 与 NR 方法相较彼此各有优劣。本文提出一种称为 CORN 的新颖框架,其融合了这两种方法,将 FR 与 NR 模型联合训练。训练后,这些模型可独立应用。我们通过预测若干常见客观指标并在两种不同架构上评估 CORN。利用 CORN 训练的 NR 模型在训练时可访问参考录音,因此正如预期,它始终优于独立训练的基线 NR 模型。或许更值得注意的是,CORN 的 FR 模型也优于其基线对应模型,尽管它依赖相同的训练数据与相同的模型架构。因此,单一训练机制产生了两个各自有用的独立模型,且均优于独立训练的模型。
引用
@article{arxiv.2310.09388,
title = {CORN: Co-Trained Full- And No-Reference Speech Quality Assessment},
author = {Pranay Manocha and Donald Williamson and Adam Finkelstein},
journal= {arXiv preprint arXiv:2310.09388},
year = {2024}
}