用于深度学习声音合成的音频表示:综述
声音
2022-01-10 v1 机器学习
音频与语音处理
摘要
深度学习的兴起使许多研究者不再使用经典信号处理方法来生成声音。深度学习模型已实现富有表现力的语音合成、逼真的声音纹理以及虚拟乐器的音符。然而,最合适的深度学习架构仍在研究中。架构的选择与音频表示紧密耦合。声音的原始波形可能过于密集和丰富,导致深度学习模型难以高效处理——且复杂度增加了训练时间与计算成本。此外,它并未以感知声音的方式来表示声音。因此,在许多情况下,原始音频已通过上采样、特征提取,甚至采用波形的更高层描述,被转换为压缩且更具意义的形式。此外,依据所选形式,研究者还探索了额外的条件表示、不同的模型架构以及众多用于评估重建声音的度量指标。本文概述了应用于深度学习声音合成的音频表示。此外,它介绍了依赖音频表示、使用深度学习模型开发和评估声音合成架构的最重要方法。
引用
@article{arxiv.2201.02490,
title = {Audio representations for deep learning in sound synthesis: A review},
author = {Anastasia Natsiou and Sean O'Leary},
journal= {arXiv preprint arXiv:2201.02490},
year = {2022}
}