中文

JukeDrummer:基于Transformer VQ-VAE的条件节拍感知音频域鼓点伴奏生成

声音 2022-11-01 v2 人工智能 机器学习 音频与语音处理

摘要

本文提出一种在音频域生成鼓轨以配合用户提供的无鼓录音的模型。具体而言,利用无鼓音轨与对应人工鼓轨的配对数据,我们训练一个Transformer模型为未见过的无鼓录音即兴创作鼓部分。我们结合两种方法来编码输入音频。首先,我们训练一个向量量化变分自编码器(VQ-VAE)以离散码表示输入音频,进而可直接用于Transformer。其次,使用音频域节拍跟踪模型计算输入音频的节拍相关特征,并将其作为Transformer中的嵌入。我们不直接将鼓轨生成为波形,而是使用另一个VQ-VAE将鼓轨的梅尔谱编码为另一组离散码,并训练Transformer预测鼓相关离散码序列。输出码随后由解码器转换为梅尔谱,再由声码器转换为波形。我们报告了所提模型各变体的客观与主观评估,表明带节拍信息的模型生成的鼓伴奏在节奏与风格上与输入音频一致。

关键词

引用

@article{arxiv.2210.06007,
  title  = {JukeDrummer: Conditional Beat-aware Audio-domain Drum Accompaniment Generation via Transformer VQ-VAE},
  author = {Yueh-Kao Wu and Ching-Yu Chiu and Yi-Hsuan Yang},
  journal= {arXiv preprint arXiv:2210.06007},
  year   = {2022}
}

备注

Accepted at ISMIR 2022