HeartMuLa:面向多模态音乐的开源音乐基础模型族
声音
2026-01-27 v2
摘要
我们提出了一套开源音乐基础模型,旨在推动跨多样任务和模态的大规模音乐理解与生成。该框架由四个主要组成部分构成:(1) HeartCLAP,一audio-text 对齐模型;(2) HeartTranscriptor,一针对实际音乐场景优化的鲁洛识别模型;(3) HeartCodec,一低帧率(12.5 Hz)但高保真的音乐编解码器标记化器,能够捕获长期音乐结构,同时保留细粒度声学细节并实现高效的自回归建模;(4) HeartMuLa,一款基于大语言模型的歌曲生成模型,能够在丰富的用户可控条件下(如文本风格描述、歌词和参考音频)合成高保真音乐。此外,它提供两种专用模式:(i) 细粒度音乐属性控制,允许用户使用自然语言提示指定不同歌曲段落(如前奏、副歌)的风格;(ii) 短小精悍的音乐生成,适合作为短视频的背景音乐。最后,HeartMuLa 在规模扩展至 7B 参数时能显著提升。我们首次展示,如何在学术规模的数据和 GPU 资源下复现出类似 Suno 的商业级系统。我们预计这些基础模型将作为未来研究的强基准,并促进多模态内容生产的实际应用。
引用
@article{arxiv.2601.10547,
title = {HeartMuLa: A Family of Open Sourced Music Foundation Models},
author = {Dongchao Yang and Yuxin Xie and Yuguo Yin and Zheyu Wang and Xiaoyu Yi and Gongxi Zhu and Xiaolong Weng and Zihan Xiong and Yingzhe Ma and Dading Cong and Jingliang Liu and Zihang Huang and Jinghan Ru and Rongjie Huang and Haoran Wan and Peixu Wang and Kuoxi Yu and Helin Wang and Liming Liang and Xianwei Zhuang and Yuanyuan Wang and Dingdong and Wang and Haohan Guo and Junjie Cao and Zeqian Ju and Songxiang Liu and Yuewen Cao and Heming Weng and Yuexian Zou},
journal= {arXiv preprint arXiv:2601.10547},
year = {2026}
}