中文

APEX:面向 AI 生成音乐的大规模多任务审美感知人气预测

声音 2026-05-06 v1 人工智能 机器学习 多媒体

摘要

音乐人气预测正在引起日益关注的研究,因其与艺术家、平台和推荐系统密切相关。然而,AI 生成音乐平台的爆发式增长创造了一个全新的且鲜有人探索的领域,这一领域每天生产和消费大量歌曲,而无需传统的艺术家声望或标签支持。关键且尚未被探索的因素是审美质量。我们提出 APEX,即首个针对 AI 生成音乐的大规模多任务学习框架,基于来自Suno和Udio的 21.1 万首歌曲 (10,000 小时音频)进行训练,联合预测基于流量和点赞得分的参与度信号,以及从 MERT(自监督音乐理解模型)提取的冻结音频嵌入中预测的五个感知审美质量维度。审美质量和人气捕获了音乐的互补方面,二者综合而有价值:在针对 Music Arena 数据集的离线评估中,该数据集包含来自训练期未见的十一家生成音乐系统的成对人类偏好对战,包括审美特征持续改善偏好预测,展示了所学表示在不同生成架构之间的强大泛化。

关键词

引用

@article{arxiv.2605.03395,
  title  = {APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music},
  author = {Jaavid Aktar Husain and Dorien Herremans},
  journal= {arXiv preprint arXiv:2605.03395},
  year   = {2026}
}