TEAdapter:为可控文本到音乐生成提供丰富的指导
声音
2024-08-12 v1 多媒体
音频与语音处理
摘要
尽管当前的文本导向音乐生成技术能够应对简单的创意场景,但要实现对单个文本-模态条件的细粒度控制仍然具有挑战性,因为用户需求日益复杂。为此,我们引入了 TEAcher Adapter(TEAdapter),这是一个紧凑的插件,用于通过用户提供的多样控制信息指导生成过程。此外,我们通过利用在不同结构功能数据上训练的 TEAdapter 控制组,探索了扩展音乐的可控生成。在一般情况下,我们考虑对全局、元素和结构层面的控制。实验结果表明,提出的 TEAdapter 能够实现多种精确控制,并确保高质量的音乐生成。我们的模块也轻量可转移,可应用于任何扩散模型架构。将来会在 https://github.com/Ashley1101/TEAdapter 上提供可用代码和演示。
引用
@article{arxiv.2408.04865,
title = {TEAdapter: Supply abundant guidance for controllable text-to-music generation},
author = {Jialing Zou and Jiahao Mei and Xudong Nan and Jinghua Li and Daoguo Dong and Liang He},
journal= {arXiv preprint arXiv:2408.04865},
year = {2024}
}
备注
Accepted by ICME'24: IEEE International Conference on Multimedia and Expo