中文

EVA-GAN:通过可扩展生成对抗网络增强多样化音频生成

声音 2024-02-05 v1 人工智能 机器学习 音频与语音处理

摘要

大型模型的出现标志着机器学习的新纪元,通过利用海量数据集捕捉和合成复杂模式,显著优于较小模型。尽管取得了这些进展,但在音频生成领域对扩展性的探索仍然有限,以往的工作未能扩展到高保真(HiFi)44.1kHz领域,并且在高频域存在频谱不连续性和模糊性,同时缺乏对域外数据的鲁棒性。这些限制限制了模型在包括音乐和歌声生成在内的多样化用例中的适用性。我们的工作引入了通过可扩展生成对抗网络增强多样化音频生成(EVA-GAN),在频谱和高频重建以及域外数据性能的鲁棒性方面相比先前的最先进技术取得了显著改进,通过使用包含36,000小时44.1kHz音频的广泛数据集、上下文感知模块、人机协同伪影测量工具包,并将模型扩展到约2亿个参数,实现了高保真音频的生成。我们的工作演示可在https://double-blind-eva-gan.cc获取。

关键词

引用

@article{arxiv.2402.00892,
  title  = {EVA-GAN: Enhanced Various Audio Generation via Scalable Generative Adversarial Networks},
  author = {Shijia Liao and Shiyi Lan and Arun George Zachariah},
  journal= {arXiv preprint arXiv:2402.00892},
  year   = {2024}
}