中文

文本到音乐评估与人类偏好的对齐

声音 2025-03-24 v1 人工智能 音频与语音处理

摘要

尽管生成式声学文本到音乐 (TTM) 建模取得了显著进展,但这些模型的稳健评估仍相对滞后,尤其依赖于流行的 Fréchet 音频距离 (FAD)。在本工作中,我们通过 (1) 设计四种合成元评估来衡量对特定音乐期望的敏感性,以及 (2) 收集并评估 MusicPrefs——首个面向 TTM 系统的人类偏好开源数据集——严格研究了用于评估 TTM 模型的基于参考的散度指标的设计空间。我们发现,标准 FAD 设置在合成数据和人类偏好数据上均不一致,并且几乎所有现有指标都未能有效捕捉期望特征,且与人类感知仅弱相关。我们提出了一种新指标——MAUVE 音频散度 (MAD),在自监督音频嵌入模型的表示上计算。我们发现该指标能有效捕捉多样化的音乐期望特征(MAD 的平均秩相关系数为 0.84,FAD 为 0.49),并且与 MusicPrefs 的相关性也更强(0.62 vs. 0.14)。

关键词

引用

@article{arxiv.2503.16669,
  title  = {Aligning Text-to-Music Evaluation with Human Preferences},
  author = {Yichen Huang and Zachary Novack and Koichi Saito and Jiatong Shi and Shinji Watanabe and Yuki Mitsufuji and John Thickstun and Chris Donahue},
  journal= {arXiv preprint arXiv:2503.16669},
  year   = {2025}
}