中文

SMITIN:用于生成式音乐 Transformer 的自监控推理时干预

声音 2025-02-04 v2 音频与语音处理

摘要

我们提出了自监控推理时干预(SMITIN),一种使用分类器探针控制自回归生成式音乐 Transformer 的方法。这些简单的逻辑回归探针在一组同时具备和缺失特定音乐特征(例如,有无鼓声,或真实/合成音乐)的小型音频示例数据集上,利用 Transformer 中每个注意力头的输出进行训练。随后,我们沿探针方向引导注意力头,以确保生成模型的输出捕获所需的音乐特征。此外,我们监控探针输出以避免对自回归生成过程施加过度干预,这可能导致音乐在时间上不连贯。我们在音频续写和文本到音乐应用上对结果进行了客观和主观验证,展示了为大型生成模型添加控制的能力,而对大多数音乐人来说,对这些模型进行重训练甚至微调都是不切实际的。所提出的干预方法的音频示例可在我们的演示页面 http://tinyurl.com/smitin 获取。

关键词

引用

@article{arxiv.2404.02252,
  title  = {SMITIN: Self-Monitored Inference-Time INtervention for Generative Music Transformers},
  author = {Junghyun Koo and Gordon Wichern and Francois G. Germain and Sameer Khurana and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2404.02252},
  year   = {2025}
}