URGENT-PK:面向语音增强竞赛的感知对齐排名模型
音频与语音处理
2025-07-01 v1 声音
摘要
平均意见分数(MOS)是语音质量评估的基本指标,但其获取需要大量的人工标注。尽管开发了 DNSMOS 和 UTMOS 等深度神经网络方法来预测 MOS 以规避此问题,但它们往往 suffer from 训练数据不足。鉴于语音增强(SE)系统的比较更侧重可靠的系统比较而非绝对分数,我们提出 URGENT-PK,一种 novel 的排名方法,利用成对比较。URGENT-PK 以同构增强语音对为输入,预测相对质量排名。这种成对范式高效地利用有限的训练数据,因为多个系统的所有成对排列构成一个训练实例。跨多个开放测试集的实验表明,URGENT-PK 在系统层面的排名性能优于 state-of-the-art baseline,尽管其网络结构简单且训练数据有限。
引用
@article{arxiv.2506.23874,
title = {URGENT-PK: Perceptually-Aligned Ranking Model Designed for Speech Enhancement Competition},
author = {Jiahe Wang and Chenda Li and Wei Wang and Wangyou Zhang and Samuele Cornell and Marvin Sach and Robin Scheibler and Kohei Saijo and Yihui Fu and Zhaoheng Ni and Anurag Kumar and Tim Fingscheidt and Shinji Watanabe and Yanmin Qian},
journal= {arXiv preprint arXiv:2506.23874},
year = {2025}
}
备注
Submitted to ASRU2025