中文

面向音乐理解的基础模型概览

声音 2024-09-17 v1 人工智能 多媒体 音频与语音处理

摘要

音乐是生活中不可或缺的要素,满足情感和娱乐需求,并将我们个人、社会和文化联系在一起。更好的音乐理解可以提升我们的情感、认知技能和文化联系。人工智能(AI)的快速发展为分析音乐的新方式提供了可能,旨在复制人类对音乐的理解并提供相关服务。虽然传统模型侧重于音频特征和简单任务,但近期大型语言模型(LLM)和基础模型(foundation models, FMs)在各领域展现出将语义信息融入并具备强大推理能力的优势,这可能捕获复杂的音乐特征和模式,将音乐与语言整合,并融合丰富的音乐、情感和心理知识。因此,它们有望从语义角度处理复杂的音乐理解任务,产生接近人类感知的输出。本工作据称是AI技术与音乐理解交叉领域的早期综述之一。我们研究、分析并测试了最新的大规模音乐基础模型在其音乐理解能力方面。我们也讨论了其局限性并提出了可能的未来方向,为该领域的研究者提供了洞见。

关键词

引用

@article{arxiv.2409.09601,
  title  = {A Survey of Foundation Models for Music Understanding},
  author = {Wenjun Li and Ying Cai and Ziyang Wu and Wenyi Zhang and Yifan Chen and Rundong Qi and Mengqi Dong and Peigen Chen and Xiao Dong and Fenghao Shi and Lei Guo and Junwei Han and Bao Ge and Tianming Liu and Lin Gan and Tuo Zhang},
  journal= {arXiv preprint arXiv:2409.09601},
  year   = {2024}
}

备注

20 pages, 2 figures