基于学习质量评估的多指标监督语音增强
声音
2025-08-25 v2 音频与语音处理
摘要
语音质量评估(SQA)旨在预测广泛失真条件下语音信号的感知质量。它与语音增强(SE)密切相关,后者通过去除不需要的信号成分来提升语音质量。虽然SQA模型被广泛用于评估SE性能,但其指导SE训练的潜力尚未得到充分探索。在本工作中,我们研究了一种训练框架,利用一个SQA模型作为SE的监督信号,该SQA模型经过训练可从公共SE排行榜预测多个评估指标。该方法解决了传统SE目标(如SI-SNR)的关键局限性,后者往往无法与感知质量对齐,且在不同评估指标之间泛化能力差。此外,它使得在无法获取干净参考的真实世界数据上进行训练成为可能。在模拟和真实世界测试集上的实验表明,SQA引导的训练在一系列质量指标上持续提升性能。代码和检查点可在 https://github.com/urgent-challenge/urgent2026_challenge_track2 获取。
引用
@article{arxiv.2506.12260,
title = {Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment},
author = {Wei Wang and Wangyou Zhang and Chenda Li and Jiatong Shi and Shinji Watanabe and Yanmin Qian},
journal= {arXiv preprint arXiv:2506.12260},
year = {2025}
}
备注
Accepted by ASRU 2025