MusicAgent:基于大语言模型的音乐理解与生成 AI 智能体
计算与语言
2023-10-26 v2 多媒体
音频与语音处理
摘要
AI 赋能的音乐处理是一个多样化的领域,涵盖数十种任务,从生成任务(如音色合成)到理解任务(如音乐分类)。对于开发者和爱好者而言,很难掌握所有这些任务以满足其音乐处理需求,尤其考虑到音乐数据表示间的巨大差异以及各任务间模型跨平台的适用性。因此,有必要构建一个系统来组织并集成这些任务,从而帮助从业者自动分析其需求并调用合适的工具作为解决方案以满足其要求。受近期大语言模型(LLM)在任务自动化方面成功的启发,我们开发了一个名为 MusicAgent 的系统,它集成了众多音乐相关工具与自主工作流以应对用户需求。更具体地,我们构建了 1)从多样来源(包括 Hugging Face、GitHub 和 Web API 等)收集工具的工具体系;2)由 LLM(如 ChatGPT)赋能的自主工作流,用于组织这些工具并自动将用户请求分解为多个子任务并调用相应的音乐工具。该系统的首要目标是将用户从 AI 音乐工具的复杂细节中解放出来,使其能专注于创作层面。通过赋予用户轻松组合工具的自由,系统提供了无缝且丰富的音乐体验。
引用
@article{arxiv.2310.11954,
title = {MusicAgent: An AI Agent for Music Understanding and Generation with Large Language Models},
author = {Dingyao Yu and Kaitao Song and Peiling Lu and Tianyu He and Xu Tan and Wei Ye and Shikun Zhang and Jiang Bian},
journal= {arXiv preprint arXiv:2310.11954},
year = {2023}
}