使用 Transformer-GANs 生成带情感的音乐
声音
2022-12-22 v1 机器学习
音频与语音处理
摘要
得益于深度学习的出现,自动音乐生成领域取得了显著进展。然而,这些成果大多由无条件模型产生,缺乏与用户交互的能力,无法让用户以有意义且实用的方式引导生成过程。此外,合成在较长时间尺度上保持连贯同时又捕捉使其听起来“真实”或“类人”的局部特征的音乐仍具挑战性。这是由于处理长数据序列所需的大量计算需求,以及常采用的训练方案所带来的局限。本文提出一种以人类情感数据为条件的符号音乐生成模型。该模型为 Transformer-GAN,以对应于效价与唤醒维度不同配置的标签训练,这些维度定量表示人类情感状态。我们尝试通过采用高效的线性注意力版本,并将判别器同时用作提升生成音乐整体质量及其遵循条件信号能力的工具,来解决上述两个问题。
引用
@article{arxiv.2212.11134,
title = {Generating music with sentiment using Transformer-GANs},
author = {Pedro Neves and Jose Fornari and João Florindo},
journal= {arXiv preprint arXiv:2212.11134},
year = {2022}
}