中文

面向 AI 音乐生成的开源逐样本质量评估指标 MuQ-Eval

人工智能 2026-03-25 v1 声音

摘要

分布式指标如 F\'{e}ch\'{e}t Audio Distance 无法对单个音乐片段进行评分,且与人类判断关联性较差;而唯一实现高人类关联性的逐样本学习指标却是闭源的。我们介绍 MUQ-EVAL,这是一个用于 AI 生成音乐的开源逐样本质量指标,通过在冻结的 MuQ-310M 特征上训练轻量级预测头来实现,该模型基于 MusicEval 训练而来,后者包含来自 31 个文本到音乐系统生成的音频剪辑及专家质量评分。我们的简化模型——冻结特征结合注意力池化和两层 MLP——在系统层面实现 SRCC = 0.957,在片段层面实现 SRCC = 0.838,分别与人类平均意见得分呈高度相关。对训练目标和适应策略进行的系统消融实验表明,无任何额外改进能提升冻结基线,表明冻结的 MuQ 表示已经捕获了与质量相关的特征。编码器选择是主要的设计因素,凌驾于所有架构和训练决策之上。即使仅使用 150 个音频片辑训练的 LoRA 适应模型也能实现可用水平的相关性,从而 enables 从单个听众注释中构建个性化质量评估器。我们进行的受控退化分析揭示了对信号级失真具有选择性敏感性,但对音乐结构失真不敏感。我们的指标 MUQ-EVAL 完全开源,超越现有开源逐样本指标,在单个消费级 GPU 上可实时运行。代码、模型权重和评估脚本均已公开于 https://github.com/dgtql/MuQ-Eval。

关键词

引用

@article{arxiv.2603.22677,
  title  = {MuQ-Eval: An Open-Source Per-Sample Quality Metric for AI Music Generation Evaluation},
  author = {Di Zhu and Zixuan Li},
  journal= {arXiv preprint arXiv:2603.22677},
  year   = {2026}
}

备注

10 Pages, 6 figures