中文

JASTIN:通过自然语言指令对齐LLM以实现零样本音频与语音评估

音频与语音处理 2026-05-07 v1 人工智能 声音

摘要

生成式音频模型的快速发展已超越了鲁棒评估方法的发展步伐。现有的客观指标和通用多模态大语言模型在领域泛化、零样本能力和指令灵活性方面常常面临困难。为解决这些瓶颈,我们提出了JASTIN,一个可泛化、指令驱动的音频评估框架,将音频评估构建为自指令推理任务。JASTIN通过可训练的音频适配器将冻结的高性能音频编码器与微调的LLM骨干网络连接起来。为确保鲁棒的零样本泛化能力,我们引入了全面的指令跟随数据准备流水线,整合了多源、多任务、多校准和多描述数据。实验结果表明,JASTIN在与人类主观评分之间达到了最先进的Pearson和Spearman相关性。在语音、声音、音乐和域外评估任务中,它始终优于通用多模态大语言模型,且无需进行特定任务的重新训练。

关键词

引用

@article{arxiv.2605.04505,
  title  = {JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions},
  author = {Leying Zhang and Bowen Shi and Haibin Wu and Bach Viet Do and Yanmin Qian},
  journal= {arXiv preprint arXiv:2605.04505},
  year   = {2026}
}