SpeechQualityLLM:基于大语言模型的语音质量多模态评估
声音
2025-12-10 v1 人工智能
摘要
客观语音质量评估是电话、VoIP 和流媒体系统的核心任务,其中需要大规模监控和优化大量降级音频。经典指标如 PESQ 和 POLQA 模拟人类平均意见分数(MOS),但需要受控的条件和昂贵的听力测试;而学习式模型如 NISQA 从波形或声谱图回归 MOS 和多个感知维度,实现高度相关性,但仍僵化:不支持交互式自然语言查询,也不原生提供文本化解释。本文引入 SpeechQualityLLM,一个语音质量问答(QA)多模态系统,将音频编码器与语言模型耦合,基于 NISQA 语料库训练,采用模板化问答对,覆盖整体 MOS 及四个感知维度(噪声性、颜色、断裂和音量),分别针对单端(仅降级)和双端(降级加干净参考)方案。与直接回归分数不同,我们的系统被监督生成文本化答案,进而解析数值预测,并以标准回归和排序指标评估;在 held-out NISQA 剪辑上,双端模型实现 MOS 平均绝对误差(MAE)为 0.41,皮尔逊相关系数为 0.86,维度任务表现竞争。除了这些量化收益之外,它提供灵活的自然语言界面,语言模型充当音频质量专家:实践者可查询降级的任意方面,引导模型模拟不同听众轮廓以捕捉人类变异性,产生多样且合情合理的判断而非单一确定性分数,从而减少对大规模众包测试及其高额成本的依赖。
引用
@article{arxiv.2512.08238,
title = {SpeechQualityLLM: LLM-Based Multimodal Assessment of Speech Quality},
author = {Mahathir Monjur and Shahriar Nirjon},
journal= {arXiv preprint arXiv:2512.08238},
year = {2025}
}
备注
9 pages, 5 figures, 8 tables