中文

TEAdapter:为可控文本到音乐生成提供丰富的指导

声音 2024-08-12 v1 多媒体 音频与语音处理

摘要

尽管当前的文本导向音乐生成技术能够应对简单的创意场景,但要实现对单个文本-模态条件的细粒度控制仍然具有挑战性,因为用户需求日益复杂。为此,我们引入了 TEAcher Adapter(TEAdapter),这是一个紧凑的插件,用于通过用户提供的多样控制信息指导生成过程。此外,我们通过利用在不同结构功能数据上训练的 TEAdapter 控制组,探索了扩展音乐的可控生成。在一般情况下,我们考虑对全局、元素和结构层面的控制。实验结果表明,提出的 TEAdapter 能够实现多种精确控制,并确保高质量的音乐生成。我们的模块也轻量可转移,可应用于任何扩散模型架构。将来会在 https://github.com/Ashley1101/TEAdapter 上提供可用代码和演示。

关键词

引用

@article{arxiv.2408.04865,
  title  = {TEAdapter: Supply abundant guidance for controllable text-to-music generation},
  author = {Jialing Zou and Jiahao Mei and Xudong Nan and Jinghua Li and Daoguo Dong and Liang He},
  journal= {arXiv preprint arXiv:2408.04865},
  year   = {2024}
}

备注

Accepted by ICME'24: IEEE International Conference on Multimedia and Expo