ST-ITO:通过推理时优化控制音频效果以实现风格迁移
声音
2024-10-29 v1 音频与语音处理
摘要
音频制作风格迁移的任务是处理输入音频,以赋予其来自参考录音的风格元素。现有方法通常训练一个神经网络来估计一组音频效果的控制参数。然而,这些方法的局限性在于它们只能控制一组固定的效果,并且这些效果必须是可微的,或者需要采用专门的训练技术。在这项工作中,我们引入了 ST-ITO,即通过推理时优化进行风格迁移,这种方法在推理时搜索音频效果链的参数空间。该方法能够控制任意的音频效果链,包括未见过的和不可微的效果。我们的方法采用了一个学习到的音频制作风格度量,我们通过一种简单且可扩展的自监督预训练策略以及一个无梯度优化器来训练该度量。由于现有的音频制作风格迁移评估方法有限,我们引入了一个多部分基准来评估音频制作风格度量和风格迁移系统。该评估表明,我们的音频表示能更好地捕捉与音频制作相关的属性,并通过控制任意音频效果实现富有表现力的风格迁移。
引用
@article{arxiv.2410.21233,
title = {ST-ITO: Controlling Audio Effects for Style Transfer with Inference-Time Optimization},
author = {Christian J. Steinmetz and Shubhr Singh and Marco Comunità and Ilias Ibnyahya and Shanxin Yuan and Emmanouil Benetos and Joshua D. Reiss},
journal= {arXiv preprint arXiv:2410.21233},
year = {2024}
}
备注
Accepted to ISMIR 2024. Code available https://github.com/csteinmetz1/st-ito