探索经典钢琴演奏生成——基于表现力音乐变分自编码器
声音
2025-07-03 v1 人工智能
多媒体
音频与语音处理
摘要
经典音乐的创造性不仅来自作曲家构建音乐谱曲,更来自演奏家对静态记谱符号进行表现性细微解读。本文旨在从零生成经典钢琴演奏,模拟创作过程中作曲家与钢琴家的双重角色。我们提出了表现力复合词(Expressive Compound Word, ECP)表示方法,有效捕捉经典演奏的节奏结构与表现性细微差别。基于此,我们提出表现力音乐变分自编码器(Expressive Music Variational AutoEncoder, XMVAE),该模型包含两个分支:一个用于生成与谱曲相关内容的向量量化变分自编码器(VQ-VAE)分支,代表作曲家角色;另一个生成表现性细节的普通VAE分支,承担钢琴家角色。两者采用相似的序列到序列架构进行联合训练,利用多尺度编码器捕获节拍级别的上下文信息,以及正交Transformer解码器实现高效的复合token解码。通过客观和主观评估,实验表明XMVAE生成的经典演奏在音乐质量上优于当前最先进的模型。此外,针对额外音乐谱曲数据集对作曲家分支进行预训练可显著提升模型性能。
引用
@article{arxiv.2507.01582,
title = {Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder},
author = {Jing Luo and Xinyu Yang and Jie Wei},
journal= {arXiv preprint arXiv:2507.01582},
year = {2025}
}
备注
Accepted by IEEE SMC 2025