探索基于变换器的文本到音乐模型的可压缩性
音频与语音处理
2024-06-26 v1 多媒体
声音
摘要
最先进的文本到音乐 (TTM) 生成式 AI 模型规模庞大,需要桌面级或服务器级计算,使得其在移动设备上不可行部署。本文present了模型压缩与生成性能之间的权衡分析。我们通过知识蒸馏和特定修改,研究TTM模型各组件(编码器、生成模型和解码器)的压缩。借助这些方法,我们创建了 TinyTTM (89.2M 参数),在 MusicBench 数据集上实现 FAD 为 3.66,KL 为 1.32,优于 MusicGen-Small (557.6M 参数),但未达到在 MusicBench 上微调的 MusicGen-small。
引用
@article{arxiv.2406.17159,
title = {Exploring compressibility of transformer based text-to-music (TTM) models},
author = {Vasileios Moschopoulos and Thanasis Kotsiopoulos and Pablo Peso Parada and Konstantinos Nikiforidis and Alexandros Stergiadis and Gerasimos Papakostas and Md Asif Jalal and Jisi Zhang and Anastasios Drosou and Karthikeyan Saravanan},
journal= {arXiv preprint arXiv:2406.17159},
year = {2024}
}
备注
Proceedings of INTERSPEECH 2024