中文

使用单个非自回归Transformer的掩码音频生成

声音 2024-03-06 v2 人工智能 机器学习 音频与语音处理

摘要

我们提出了MAGNeT,这是一种直接在多个音频令牌流上操作的掩码生成式序列建模方法。与先前工作不同,MAGNeT由一个单阶段、非自回归的Transformer组成。在训练期间,我们预测从掩码调度器获得的掩码令牌片段,而在推理期间,我们使用多个解码步骤逐步构建输出序列。为了进一步提高生成音频的质量,我们引入了一种新颖的重评分方法,利用外部预训练模型对MAGNeT的预测进行重评分和排序,然后将其用于后续的解码步骤。最后,我们探索了MAGNeT的混合版本,其中融合了自回归和非自回归模型,以自回归方式生成前几秒,而序列的其余部分则并行解码。我们展示了MAGNeT在文本到音乐和文本到音频生成任务上的效率,并进行了广泛的实证评估,同时考虑了客观指标和人类研究。所提出的方法与评估的基线相当,但速度显著更快(比自回归基线快7倍)。通过消融研究和分析,我们阐明了构成MAGNeT的每个组件的重要性,并指出了自回归与非自回归建模之间在延迟、吞吐量和生成质量方面的权衡。样本可在我们的演示页面https://pages.cs.huji.ac.il/adiyoss-lab/MAGNeT上获取。

关键词

引用

@article{arxiv.2401.04577,
  title  = {Masked Audio Generation using a Single Non-Autoregressive Transformer},
  author = {Alon Ziv and Itai Gat and Gael Le Lan and Tal Remez and Felix Kreuk and Alexandre Défossez and Jade Copet and Gabriel Synnaeve and Yossi Adi},
  journal= {arXiv preprint arXiv:2401.04577},
  year   = {2024}
}