中文

SpecSinGAN:使用单图像GAN进行音效变体合成

声音 2022-04-06 v2 机器学习 音频与语音处理

摘要

单图像生成对抗网络从单个训练样本的内部分布中学习以生成其变体,从而消除了对大型数据集的需求。在本文中,我们介绍了SpecSinGAN,这是一种无条件生成架构,它接收单个一次性音效(例如,脚步声;角色跳跃),并产生其新颖的变体,就好像它们是来自同一次录音会话的不同录制条次一样。我们探索了使用多通道频谱图在构成单个音效的各个层上训练模型。一项听力研究将我们的模型与真实录音以及数字信号处理程序化音频模型在声音合理性和变体方面进行了比较,结果表明,当使用多通道频谱图时,SpecSinGAN比所考虑的程序化音频模型更合理且更多样。声音示例可在项目网站上找到:https://www.adrianbarahonarios.com/specsingan/

关键词

引用

@article{arxiv.2110.07311,
  title  = {SpecSinGAN: Sound Effect Variation Synthesis Using Single-Image GANs},
  author = {Adrián Barahona-Ríos and Tom Collins},
  journal= {arXiv preprint arXiv:2110.07311},
  year   = {2022}
}