学习环境声音过程式音频模型的通用框架
声音
2023-03-07 v1 人工智能
音频与语音处理
摘要
本文引入了过程式(音频)变分自编码器 (ProVE) 框架,作为一种学习环境声音过程式音频 (PA) 模型的通用方法,在提升合成真实感的同时,保持通过可调参数对生成声音的控制能力。该框架包含两个阶段:(i) 音频类别表示,通过训练音频自编码器定义潜表示空间;(ii) 控制映射,学习从音频导出的静态/时间控制变量与均匀噪声随机采样的联合函数以替代音频编码器。我们以不同表面上的脚步声效果为例展示了 ProVE 的使用。我们的结果表明,根据 Fr\'echet 音频距离 (FAD)、最大均值差异 (MMD) 与主观评价衡量,ProVE 模型在声音保真度上优于经典 PA 模型与基于对抗的方法,使其成为声音设计工作流中可行的工具。
引用
@article{arxiv.2303.02396,
title = {A General Framework for Learning Procedural Audio Models of Environmental Sounds},
author = {Danzel Serrano and Mark Cartwright},
journal= {arXiv preprint arXiv:2303.02396},
year = {2023}
}