SILA:用于增强文本到音频生成控制的信噪比信号增强
声音
2024-12-16 v1 音频与语音处理
摘要
文本到音频生成领域取得了显著的进展,但对生成音频声学特性的精细控制能力仍受到关注。本文提出一种新颖且简单的方法,用于生成具有可控声学参数(如响度、音调、混响、淡入淡出、亮度、噪声和持续时间)的音效,支持声乐设计和内容创作中的创意应用。这些参数超越了传统的数字信号处理(DSP)技术,融合了学习表示,捕捉声学特性在语境下被塑造的细微差别,实现对生成音频更丰富、更细致的控制。该方法具有模型无关性,基于学习音频语义与声学特征之间的解耦。我们的做法不仅提升了文本到音频生成的灵活性和表达性,还开辟了创意音频制作和声乐设计的新方向。我们的客观和主观评估结果表明,该方法在生成高质量、可定制音频输出方面有效,且与用户规范高度一致。
引用
@article{arxiv.2412.09789,
title = {SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation},
author = {Sonal Kumar and Prem Seetharaman and Justin Salamon and Dinesh Manocha and Oriol Nieto},
journal= {arXiv preprint arXiv:2412.09789},
year = {2024}
}
备注
Website: https://sonalkum.github.io/SILA/