中文

DiffVox:用于捕捉与分析人声效果分布的可微分模型

声音 2025-08-19 v2 音频与语音处理

摘要

本研究提出了一种新颖且可解释的模型 DiffVox,用于在音乐制作中匹配人声效果。DiffVox 即"Differentiable Vocal Fx"(可微分人声效果)的缩写,它将参数化均衡、动态范围控制、延迟与混响与高效的可微分实现相结合,从而支持基于梯度的参数估计。人声预设取自两个数据集,包括来自 MedleyDB 的 70 首曲目以及来自一个私有数据集的 365 首曲目。参数相关性分析揭示了效果与参数之间的强关联,例如高通滤波器与低架滤波器常常协同工作以塑造低频,而延迟时间与延迟信号的强度相关。主成分分析揭示了与 McAdams 音色维度之间的联系,其中最重要的主成分调节感知空间感,而次要主成分影响光谱亮度。统计检验证实了参数分布的非高斯性质,凸显了人声效果空间的复杂性。这些关于参数分布的初步发现为未来在人声效果建模与自动混音方面的研究奠定了基础。源代码与数据集可在 https://github.com/SonyResearch/diffvox 获取。

关键词

引用

@article{arxiv.2504.14735,
  title  = {DiffVox: A Differentiable Model for Capturing and Analysing Vocal Effects Distributions},
  author = {Chin-Yun Yu and Marco A. Martínez-Ramírez and Junghyun Koo and Ben Hayes and Wei-Hsiang Liao and György Fazekas and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2504.14735},
  year   = {2025}
}

备注

Accepted at DAFx 2025