中文

VQCPC-GAN:基于矢量量化对比预测编码的变长对抗音频合成

声音 2021-08-02 v2 人工智能 机器学习 音频与语音处理

摘要

受计算机视觉领域影响,生成对抗网络(GAN)常采用固定尺寸的二维频谱图表示作为“图像数据”用于音频领域。然而,在(音乐)音频领域中,往往希望生成时长可变的输出。本文提出 VQCPC-GAN,一种利用矢量量化对比预测编码(VQCPC)合成变长音频的对抗框架。从真实音频数据中提取的 VQCPC 令牌序列作为 GAN 架构的条件输入,提供所生成内容的逐步时间相关特征。输入噪声 z(对抗架构中的特征量)随时间保持固定,以确保全局特征的时间一致性。我们通过将一组多样化指标与各种强基线进行比较来评估所提模型。结果表明,尽管基线得分最佳,VQCPC-GAN 即使在生成变长音频时也取得了可比的性能。配套网站提供了大量声音示例,并发布了代码以保证可复现性。

关键词

引用

@article{arxiv.2105.01531,
  title  = {VQCPC-GAN: Variable-Length Adversarial Audio Synthesis Using Vector-Quantized Contrastive Predictive Coding},
  author = {Javier Nistal and Cyran Aouameur and Stefan Lattner and Gaël Richard},
  journal= {arXiv preprint arXiv:2105.01531},
  year   = {2021}
}

备注

5 pages, 1 figure, 1 table; accepted to IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA)