大规模音乐 AI 模型在通用硬件上的本地部署
声音
2024-11-15 v1 机器学习
音频与语音处理
摘要
我们展示了 MIDInfinite,这是一个能够在通用硬件上本地使用大规模生成式 AI 模型生成符号音乐的 Web 应用。创建该演示涉及将预训练于 Lakh MIDI 数据集的大语言模型(LLM)Anticipatory Music Transformer 移植到机器学习编译(MLC)框架。模型移植后,MLC 便于在包括 C++、移动端和浏览器在内的多种运行时上进行推理。我们设想 MLC 有潜力弥合日益强大的音乐 AI 模型与音乐软件开发者更熟悉的技术之间的鸿沟。作为概念验证,我们构建了一个 Web 应用,允许用户在浏览器中生成无限的多乐器 MIDI 流,既可以从头开始,也可以基于提示条件生成。在通用硬件(M3 MacBook Pro)上,我们的演示每秒可生成 51 个音符,对于 72.9% 的生成结果快于实时播放,若预先缓冲 2 秒,该比例上升至 86.3%。
引用
@article{arxiv.2411.09625,
title = {Local deployment of large-scale music AI models on commodity hardware},
author = {Xun Zhou and Charlie Ruan and Zihe Zhao and Tianqi Chen and Chris Donahue},
journal= {arXiv preprint arXiv:2411.09625},
year = {2024}
}
备注
2 pages