LiLAC:用于音乐音频生成的轻量隐式 ControlNet
声音
2025-06-16 v1 机器学习
音频与语音处理
摘要
文本到音频扩散模型能够生成高质量和多样化的音乐,但许多(甚至大多数)最先进模型缺乏音乐制作所必需的细粒度、时变控制能力。ControlNet 通过在新条件上克隆和微调预训练生成模型的编码器,实现将外部控制附加到该模型。然而,该方法带来较大的内存占用,并将用户限制在一组固定的控制上。我们提出了一种轻量、模块化的架构,在保持 ControlNet 相当的音频质量和条件一致性方面的同时,显著减少了参数数量。我们的方法提供了更大的灵活性和显著更低的内存使用,使独立控制能够更高效地训练和部署。我们进行了广泛的客观和主观评估,并在配套网站上提供了大量音频示例:https://lightlatentcontrol.github.io
引用
@article{arxiv.2506.11476,
title = {LiLAC: A Lightweight Latent ControlNet for Musical Audio Generation},
author = {Tom Baker and Javier Nistal},
journal= {arXiv preprint arXiv:2506.11476},
year = {2025}
}
备注
Accepted at ISMIR 2025