中文

面向音乐生成的激活修补技术用于可解释引导

声音 2025-04-08 v1

摘要

理解大型音频模型如何表示音乐,以及利用这种理解来引导生成,既具有挑战性又不受欢迎。受机制可解释性在语言模型中的启发,其中变换器残差流中的方向向量是模型分析和控制的关键,我们研究了类似技术在音频领域的应用。本文首次研究了大型音频模型中的隐方向向量及其用于文本到音乐生成中音乐属性的连续控制。我们聚焦于二元概念,如节奏(快 vs. 慢)和质感(明亮 vs. 暗),通过对精选提示集使用差分均值方法计算引导向量。这些向量按系数比例注入到中间激活中,可实现对特定音乐特征的精细调制,同时保持整体音频质量。我们分析了引导强度的影响,比较了注入策略,并识别了影响最大的层。我们的发现表明,基于方向的引导作为一种更机制性和可解释的可控音乐生成方法具有巨大的潜力。

关键词

引用

@article{arxiv.2504.04479,
  title  = {Activation Patching for Interpretable Steering in Music Generation},
  author = {Simone Facchiano and Giorgio Strano and Donato Crisostomi and Irene Tallini and Tommaso Mencattini and Fabio Galasso and Emanuele Rodolà},
  journal= {arXiv preprint arXiv:2504.04479},
  year   = {2025}
}