从美学到人类偏好:评估文本到音乐系统的比较视角
音频与语音处理
2025-05-01 v1
摘要
评估生成模型仍然是一个根本性的挑战,尤其是当目标是反映人类偏好时。本文以音乐生成为案例研究,探讨了自动评估指标与人类偏好之间的差距。我们对五种最先进的音乐生成方法进行了比较实验,评估感知质量和与人类创作音乐的分布相似性。具体而言,我们评估了来自各种感知维度的合成音乐,并检查参考基准指标,如 Mauve Audio Divergence(MAD)和 Kernel Audio Distance(KAD)。我们的发现揭示了不同指标之间的显著不一致性,凸显了当前评估实践的局限性。为支持进一步的研究,我们发布了一个由来自多种模型的样本组成的基准数据集。本研究提供了更广泛的视角,关于生成模型中人类偏好对齐问题,主张在多个领域中采用更以人类为中心的评估策略。
引用
@article{arxiv.2504.21815,
title = {From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems},
author = {Huan Zhang and Jinhua Liang and Huy Phan and Wenwu Wang and Emmanouil Benetos},
journal= {arXiv preprint arXiv:2504.21815},
year = {2025}
}