中文

迈向可控音频纹理变形

音频与语音处理 2024-10-08 v1 人工智能 声音

摘要

本文中,我们提出一种数据驱动方法,训练一个以“软标签”为条件的生成对抗网络(GAN),该软标签提炼自在一个目标音频纹理类别集上训练的音频分类器的倒数第二层。我们证明此类条件或控制向量之间的插值可提供所生成音频纹理之间的平滑变形,并且与最先进的方法相比表现出相似或更好的音频纹理变形能力。所提方法产生了一个组织良好的潜空间,在保持与条件参数语义一致的同时生成新颖的音频输出。这是迈向通用数据驱动方法的一步,用以设计具有定制控制、能够遍历分布外区域进行新颖声音合成的生成音频模型。

关键词

引用

@article{arxiv.2304.11648,
  title  = {Towards Controllable Audio Texture Morphing},
  author = {Chitralekha Gupta and Purnima Kamath and Yize Wei and Zhuoyao Li and Suranga Nanayakkara and Lonce Wyse},
  journal= {arXiv preprint arXiv:2304.11648},
  year   = {2024}
}

备注

accepted to ICASSP 2023