音乐领域的基础模型:综述
声音
2024-09-04 v3 人工智能
计算与语言
机器学习
音频与语音处理
摘要
近年来,基础模型(FMs)如大型语言模型(LLMs)和潜在扩散模型(LDMs)对多个领域产生了深远影响,包括音乐。本综述全面审查了音乐领域的最新预训练模型和基础模型,涵盖从表征学习、生成学习到多模态学习。我们首先阐述了音乐在各行业的重要性,并追溯了 AI 在音乐中的演进。通过界定基础模型所针对的模态,我们发现许多音乐表征在 FM 开发中尚未得到充分探索。然后,我们聚焦于以往方法在 diverse music applications 上的缺乏通用性,以及基础模型在音乐理解、生成和医学应用中的潜力。通过全面探讨模型预训练范式、架构选择、标记化、微调方法和可控性, 我们强调了一些应当得到充分探索的重要议题,如指令调优和情境学习、比例规律和涌现能力,以及长序列建模等。专门章节呈现了关于音乐智能体的见解,伴随对预训练和下游任务必需的数据集和评估的 thorough 分析。最后,强调伦理考量的重要性,我们呼吁在音乐基础模型的研究中应更加关注可解释性、透明度、人类责任和版权问题等议题。这篇论文为音乐领域的基础模型提供了未来挑战和趋势的见解,旨在塑造人机在音乐领域的合作轨迹。
引用
@article{arxiv.2408.14340,
title = {Foundation Models for Music: A Survey},
author = {Yinghao Ma and Anders Øland and Anton Ragni and Bleiz MacSen Del Sette and Charalampos Saitis and Chris Donahue and Chenghua Lin and Christos Plachouras and Emmanouil Benetos and Elona Shatri and Fabio Morreale and Ge Zhang and György Fazekas and Gus Xia and Huan Zhang and Ilaria Manco and Jiawen Huang and Julien Guinot and Liwei Lin and Luca Marinelli and Max W. Y. Lam and Megha Sharma and Qiuqiang Kong and Roger B. Dannenberg and Ruibin Yuan and Shangda Wu and Shih-Lun Wu and Shuqi Dai and Shun Lei and Shiyin Kang and Simon Dixon and Wenhu Chen and Wenhao Huang and Xingjian Du and Xingwei Qu and Xu Tan and Yizhi Li and Zeyue Tian and Zhiyong Wu and Zhizheng Wu and Ziyang Ma and Ziyu Wang},
journal= {arXiv preprint arXiv:2408.14340},
year = {2024}
}