用于描述性语音质量评估的校准-推理框架
音频与语音处理
2026-03-12 v1 计算与语言
摘要
可解释的语音质量评估需要超越平均意见分数(MOS)来分析潜在的感知维度。为此,我们引入一种新型预训练方法,将基础 Audio 大型语言模型定制化为多维推理、检测和分类音频伪影。首先,校准阶段使模型预测预定义的感知维度;其次,强化学习阶段利用基于组相对策略优化(GRPO)进行维度特定奖励,以显著提升描述的准确性和质量问题的时间局部化。通过该方法,我们在多维 QualiSpeech 基准测试上达到 0.71 的平均 PCC 分数,并实现了 13% 的 MOS 预测提升,归功于基于 RL 的推理。此外,我们的细粒度 GRPO 奖励显著推进了模型定位和对音频伪影进行时间分类的能力。
关键词
引用
@article{arxiv.2603.10175,
title = {Calibration-Reasoning Framework for Descriptive Speech Quality Assessment},
author = {Elizaveta Kostenok and Mathieu Salzmann and Milos Cernak},
journal= {arXiv preprint arXiv:2603.10175},
year = {2026}
}
备注
Submitted to Interspeech 2026