ReFESS-QI:基于自监督学习的语音分离无参考质量与情境 intelligibility 评估框架
音频与语音处理
2025-10-28 v2 声音
摘要
语音分离是各种语音处理任务(如自动语音识别, ASR)的关键预处理步骤。传统上,语音分离的评估指标依赖于匹配的参考音频和相应的转录文本来评估音频质量和情境。然而,这些指标无法用于评估没有参考材料的实际混合音。本文引入了一个基于自监督学习 (SSL) 表示的无文本无参考评估框架。该框架利用混合音和分离后的音轨联合预测音频质量(通过尺度不变信噪比 (SI-SNR) 指标)和语音情境(通过词错误率 (WER) 指标)。我们在 WHAMR! 数据集上进行了实验,结果显示 WER 估计的平均绝对误差 (MAE) 为 17%,皮尔逊相关系数 (PCC) 为 0.77;SI-SNR 估计的 MAE 为 1.38,PCC 为 0.95。我们进一步通过使用各种 SSL 表示演示了该估计器的鲁棒性。
引用
@article{arxiv.2510.21014,
title = {ReFESS-QI: Reference-Free Evaluation For Speech Separation With Joint Quality And Intelligibility Scoring},
author = {Ari Frummer and Helin Wang and Tianyu Cao and Adi Arbel and Yuval Sieradzki and Oren Gal and Jesús Villalba and Thomas Thebaud and Najim Dehak},
journal= {arXiv preprint arXiv:2510.21014},
year = {2025}
}