中文

SyMuPe:富有表现力且可控的符号音乐演奏

声音 2025-11-06 v1 机器学习 多媒体

摘要

情感对于音乐演奏的创作和感知至关重要。然而,通过机器学习模型实现类似人类的表现力和情感以进行演奏渲染仍然是一项具有挑战性的任务。在这项工作中,我们提出了 SyMuPe,一个用于开发和训练富有表现力且可控的符号钢琴演奏模型的新框架。我们的旗舰模型 PianoFlow 使用条件流匹配进行训练,以解决多样的多掩码演奏修复任务。通过设计,它支持音乐演奏特征的无条件生成和填充。在训练中,我们使用一个经过整理和清洗的数据集,包含 2,968 小时的对齐乐谱和富有表现力的 MIDI 演奏。对于文本和情感控制,我们集成了一个钢琴演奏情感分类器,并使用情感加权的 Flan-T5 文本嵌入作为条件输入来微调 PianoFlow。针对基于 Transformer 的基线和现有模型的主客观评估表明,PianoFlow 不仅优于其他方法,而且达到了与人类录制和转录的 MIDI 样本相当的演奏质量。对于情感控制,我们展示并分析了在不同文本条件场景下生成的样本。所开发的模型可以集成到交互式应用中,有助于创建更易访问和更具吸引力的音乐演奏系统。

关键词

引用

@article{arxiv.2511.03425,
  title  = {SyMuPe: Affective and Controllable Symbolic Music Performance},
  author = {Ilya Borovik and Dmitrii Gavrilev and Vladimir Viro},
  journal= {arXiv preprint arXiv:2511.03425},
  year   = {2025}
}

备注

ACM Multimedia 2025. Extended version with supplementary material