中文

TinyMusician:利用知识蒸馏和混合精度量化的设备端音乐生成

声音 2025-09-03 v1 人工智能 音频与语音处理

摘要

生成模型的成功在音乐生成领域获得了前所未有的关注。基于Transformer的架构为模型性能设立了新的基准。然而,它们的实际应用受到一些关键挑战的阻碍:由于参数数量庞大,对计算资源和推理时间的要求很高。这些障碍使得它们难以部署在计算资源有限的边缘设备上,如智能手机和可穿戴设备。在这项工作中,我们提出了TinyMusician,一个从MusicGen(一种最先进的音乐生成模型)蒸馏而来的轻量级音乐生成模型。TinyMusician集成了两项创新:(i) 阶段混合的双向与偏斜KL散度,以及 (ii) 自适应混合精度量化。实验结果表明,TinyMusician保留了MusicGen-Small 93%的性能,同时模型大小减少了55%。TinyMusician是首个可移动部署的音乐生成模型,它消除了对云的依赖,同时保持了高音频保真度和高效的资源使用。

关键词

引用

@article{arxiv.2509.00914,
  title  = {TinyMusician: On-Device Music Generation with Knowledge Distillation and Mixed Precision Quantization},
  author = {Hainan Wang and Mehdi Hosseinzadeh and Reza Rawassizadeh},
  journal= {arXiv preprint arXiv:2509.00914},
  year   = {2025}
}

备注

12 pages for main context, 5 figures