多视角MidiVAE:融合音轨与小节视角表示的长序列多轨符号音乐生成
声音
2024-01-17 v1 人工智能
音频与语音处理
摘要
变分自编码器(VAEs)是神经符号音乐生成的关键组成部分,其中一些工作已取得显著成果并引起广泛关注。然而,以往的VAEs仍面临特征序列过长及生成结果缺乏上下文连贯性的问题,因此建模长序列多轨符号音乐的挑战仍未解决。为此,我们提出多视角MidiVAE,作为有效建模并生成长序列多轨符号音乐的VAE方法先驱之一。多视角MidiVAE利用二维(2-D)表示OctupleMIDI捕捉音符间关系,同时缩短特征序列长度。此外,我们通过采用混合变分编码-解码策略融合音轨视角和小节视角MidiVAE特征,关注乐器特性与和声以及音乐作品的全局与局部信息。在CocoChorales数据集上的客观与主观实验结果表明,与基线相比,多视角MidiVAE在建模长序列多轨符号音乐方面表现出显著改进。
引用
@article{arxiv.2401.07532,
title = {Multi-view MidiVAE: Fusing Track- and Bar-view Representations for Long Multi-track Symbolic Music Generation},
author = {Zhiwei Lin and Jun Chen and Boshi Tang and Binzhu Sha and Jing Yang and Yaolong Ju and Fan Fan and Shiyin Kang and Zhiyong Wu and Helen Meng},
journal= {arXiv preprint arXiv:2401.07532},
year = {2024}
}
备注
Accepted by ICASSP 2024