中文

基于高斯先验改进声乐效果风格迁移的推理时优化

声音 2025-10-20 v2 机器学习 音频与语音处理

摘要

风格迁移与推理时优化(ST-ITO)是一种最近的用于将参考音频所施加效果转移到音频轨道上的方法。它通过最小化处理后音频与参考之间的风格嵌入距离来优化效果参数。然而,该方法 treats 所有可能的配置 equally,仅依赖嵌入空间,可能导致不切实际的配置或偏差结果。我们通过在参数空间上引入源自 DiffVox 歌声预设数据集的高斯先验来解决此问题。 resulting optimization 等价于最大似然估计。在 MedleyDB 数据集上的声乐效果迁移评估显示,我们的方法在诸多指标上均显著优于基线方法,包括盲声乐效果估计器、最近邻方法以及未校准的 ST-ITO。该校准将参数均方误差降低最高可达 33%,更贴近参考风格。主观评估包含 16 名参与者,确认了本方法在数据有限时段的优势。本工作表明,在推理时引入先验知识可提升音频效果迁移的有效性,为更有效且真实的音频处理系统铺平了道路。

关键词

引用

@article{arxiv.2505.11315,
  title  = {Improving Inference-Time Optimisation for Vocal Effects Style Transfer with a Gaussian Prior},
  author = {Chin-Yun Yu and Marco A. Martínez-Ramírez and Junghyun Koo and Wei-Hsiang Liao and Yuki Mitsufuji and György Fazekas},
  journal= {arXiv preprint arXiv:2505.11315},
  year   = {2025}
}

备注

Published at WASPAA 2025