中文

Diff-MST:可微风格迁移混音

音频与语音处理 2024-07-15 v1 声音

摘要

混合风格转移自动生成给定轨道集合的多轨混合,通过从参考歌曲推断生产属性。然而,现有的混合风格转移系统局限于仅处理固定数量的轨道、引入伪影,并以端到端方式生成混合,缺乏对传统音频效果的 grounding,导致可解释性和可控性受限。为克服这些挑战,我们引入Diff-MST,一个包含可微混音控制台、Transformer控制器和音频生产风格损失函数的框架。通过输入原始轨道和参考歌曲,模型在可微混音控制台中估计音频效果的控制参数,生成高质量混合并支持事后调整。此外,模型支持任意数量的输入轨道且无需源标签,适用于实际应用。我们对模型的性能进行了全面评估,与稳健的基线方法进行了比较,展示了该方法、架构设计、量身定制的音频生产风格损失以及创新的训练方法的有效性。

关键词

引用

@article{arxiv.2407.08889,
  title  = {Diff-MST: Differentiable Mixing Style Transfer},
  author = {Soumya Sai Vanka and Christian Steinmetz and Jean-Baptiste Rolland and Joshua Reiss and George Fazekas},
  journal= {arXiv preprint arXiv:2407.08889},
  year   = {2024}
}

备注

Accepted to be published at the Proceedings of the 25th International Society for Music Information Retrieval Conference 2024