中文

音频大语言模型可作为描述性语音质量评估器

声音 2025-03-13 v2 计算与语言 音频与语音处理

摘要

理想的多模态智能体应 awareness 其输入模态的质量。近期进展使大型语言模型(LLM)能够集成听觉系统以处理各种语音相关任务。然而,大多数音频 LLM 仍缺乏对其处理语音质量的 awareness。这种限制源于语音质量评估通常因缺乏合适数据集而被排除在多任务训练之外。为此,我们引入了首个基于自然语言的语音评估语料库,源自真实人类评分。除整体平均意见分数(MOS)外,此语料库提供跨多个维度的详细分析并识别质量退化的原因。它还支持对两种语音样本的描述性比较(A/B 测试),实现类人判断。利用此语料库,我们提出了一种 LLM 蒸馏对齐方法(ALLD),引导音频 LLM 从原始语音中提取相关信息并生成有意义的响应。实验结果表明,ALLD 在 MOS 预测中超越前沿回归模型,均方误差为 0.17,A/B 测试准确率达 98.6%。此外,生成的响应在两个任务上的 BLEU 分别为 25.8 和 30.2,超越了任务特定模型的能力。这一工作推动了音频 LLM 对语音信号的全面感知,促进了现实世界听觉和感官智能代理的发展。

关键词

引用

@article{arxiv.2501.17202,
  title  = {Audio Large Language Models Can Be Descriptive Speech Quality Evaluators},
  author = {Chen Chen and Yuchen Hu and Siyin Wang and Helin Wang and Zhehuai Chen and Chao Zhang and Chao-Han Huck Yang and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2501.17202},
  year   = {2025}
}

备注

ICLR 2025