SpeechLLM-as-Judges:面向通用且可解释的语音质量评估
声音
2026-04-17 v2 音频与语音处理
摘要
生成式语音技术正迅速发展,但评估合成语音的感知质量仍是核心挑战。现有方法通常依赖标量评分或二元决策,缺乏可解释性和跨任务、跨语言的泛化能力。我们提出 SpeechLLM-as-Judges,一种新范式,使大语言模型(LLM)能够进行结构化且具有解释性的语音质量评估。为支持这一方向,我们引入 SpeechEval 数据集,包含32,207段多语言语音片段和128,754条标注,涵盖四个任务:质量评估、成对比较、改进建议和深度伪造检测。基于此资源,我们开发了 SQ-LLM,这是一款具备语音质量感知能力的 LLM,通过链式思考推理和奖励优化进行训练,以提升其性能。实验结果表明,SQ-LLM 在各任务及跨语言上的表现均优异,揭示了这一范式在推动语音质量评估方面的潜力。相关代码、模型和数据已公开于 https://github.com/NKU-HLT/SpeechLLM-as-Judges。
引用
@article{arxiv.2510.14664,
title = {SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation},
author = {Hui Wang and Jinghua Zhao and Yifan Yang and Shujie Liu and Junyang Chen and Yanzhe Zhang and Shiwan Zhao and Jinyu Li and Jiaming Zhou and Haoqin Sun and Yan Lu and Yong Qin},
journal= {arXiv preprint arXiv:2510.14664},
year = {2026}
}
备注
ACL 2026