中间结构:可微时频分析中超越谱图损失
声音
2023-01-25 v1 机器学习
音频与语音处理
摘要
计算机音乐人将中间结构称为波形微观结构与音乐宏观形式之间的中间表达层次。中间结构的例子包括旋律、琶音、切分音、复音分组与纹理对比。尽管它们在音乐表达中处于核心地位,却在深度学习中鲜受关注。当前,自动编码器与神经音频合成器仅在微观结构尺度上训练与评估:即至多约 100 毫秒的局部振幅变化。本文中,我们提出并解决中间结构音频建模问题,方法为可微琶音器与时频散射的组合。我们经实证表明,时频散射可作为支配中间结构的合成参数间相似性的可微模型。通过揭示短时谱距离对时间对齐的敏感性,我们论证了在局部频谱与谱时调制两个层面上,对时间不变且多尺度可微时频相似性模型的需求。
引用
@article{arxiv.2301.10183,
title = {Mesostructures: Beyond Spectrogram Loss in Differentiable Time-Frequency Analysis},
author = {Cyrus Vahidi and Han Han and Changhong Wang and Mathieu Lagrange and György Fazekas and Vincent Lostanlen},
journal= {arXiv preprint arXiv:2301.10183},
year = {2023}
}