中文

Music Arena:文本到音乐的现场评估

声音 2025-11-04 v2 人工智能 多媒体

摘要

我们提出了 Music Arena,一个面向文本到音乐 (TTM) 模型的开放平台,用于可扩展的人类偏好评估。通过听取研究 soliciting 人类偏好是 TTM 评估的金标准,但这些研究昂贵且难以比较,因为研究方案可能因系统而异。此外,人类偏好可能帮助研究人员对齐其 TTM 系统或改进自动评估指标,但目前不存在开放且可更新的偏好来源。我们旨在填补这些差距,通过提供*实时*评估来满足 TTM 的需求。在 Music Arena 中,real-world 用户输入自己选择的文本提示,并比较两个 TTM 系统的输出,其偏好用于编译排行榜。虽然 Music Arena 遵循其他 AI 领域的最新评估趋势,但我们也设计了针对音乐的关键特性:一种基于 LLM 的路由系统以导航 TTM 系统的异构类型签名,以及收集*详细*的偏好数据,包括听觉数据和自然语言反馈。我们还提出了一种滚动数据发布政策,确保用户隐私,提供可更新的偏好数据源并增加平台透明度。通过其标准化的评估协议、透明的数据访问政策以及音乐专门特性,Music Arena 不仅解决了 TTM 生态系统中的关键挑战,也展示了如何仔细地将实时评估适应特定 AI 领域的独特特征。Music Arena 可在 https://music-arena.org 访问。偏好数据可在 https://huggingface.co/music-arena 获取。

关键词

引用

@article{arxiv.2507.20900,
  title  = {Music Arena: Live Evaluation for Text-to-Music},
  author = {Yonghyun Kim and Wayne Chi and Anastasios N. Angelopoulos and Wei-Lin Chiang and Koichi Saito and Shinji Watanabe and Yuki Mitsufuji and Chris Donahue},
  journal= {arXiv preprint arXiv:2507.20900},
  year   = {2025}
}

备注

NeurIPS 2025 Creative AI Track