评估可微分、迭代声音匹配的声音相似度指标
声音
2025-10-10 v2 音频与语音处理
摘要
合成器的人工声设计本质上是迭代的:艺术家将合成输出与心目中的目标进行比较,调整参数,然后重复直到满意。迭代声匹配通过不断编程合成器以引导损失函数(或相似度度量)逼近目标声音来自动化此工作流程。以往对损失函数的比较通常在局限于狭小设置的情况下偏好一种指标:有限的合成方法、少量损失类型、通常没有盲听测试。这留下了一个问题:是否存在普适最优的损失函数,或者损失函数的选择是否仍是取决于合成方法和声音设计师偏好的创造性决定。我们提出了可微分的迭代声匹配作为可用文献的自然延伸,因为它将人工方法与现代机器学习进步相结合。为了分析损失函数性能在不同合成器中的可变性,我们实现了四种新型和已建立的可微分损失函数,并将其与可微分的减性、加性和 AM 合成器配对。对于每种 16 种合成器-损失函数组合,我们运行了 300 项随机化声音匹配试验。通过参数差异、频谱距离指标和手动分配的听力评分来衡量性能。我们观察到三种性能度量之间存在中等一致性。我们的方法后分析显示,损失函数性能高度取决于合成器。这些发现凸显了扩大声音匹配实验范围的价值,以及开发针对特定合成技术的新型相似度度量的重要性,而不是追求通用解决方案。
引用
@article{arxiv.2506.22628,
title = {Evaluating Sound Similarity Metrics for Differentiable, Iterative Sound-Matching},
author = {Amir Salimi and Abram Hindle and Osmar R. Zaiane},
journal= {arXiv preprint arXiv:2506.22628},
year = {2025}
}