人声发声物理模型的优化技术
音频与语音处理
2023-09-27 v1 声音
摘要
我们提出一种无监督方法来优化和评估由语音产生模型合成非语音音频效果。我们以 Pink Trombone 合成器作为声道简化产生模型的案例研究,以瞄准非语音人类音频信号——打哈欠声。我们筛选并优化合成器的控制参数,以最小化真实音频与生成音频之间的差异。我们验证了文献中报道的最常见优化技术以及一种专门设计的神经网络。我们评估了若干流行的质量度量作为误差函数,包括客观质量度量和主观等效度量。我们根据总误差与计算需求比较了结果。结果表明,遗传与群体优化器以执行较慢为代价优于最小二乘算法,且优化器与音频表示的特定组合会带来显著不同的结果。所提方法可用于对其他物理模型与音频类型进行基准测试。
引用
@article{arxiv.2309.14761,
title = {Optimization Techniques for a Physical Model of Human Vocalisation},
author = {Mateo Cámara and Zhiyuan Xu and Yisu Zong and José Luis Blanco and Joshua D. Reiss},
journal= {arXiv preprint arXiv:2309.14761},
year = {2023}
}
备注
Accepted to DAFx 2023