中文

MIDI-VALLE:通过神经编解码语言模型提高表现力钢琴演奏合成

声音 2025-07-14 v1 人工智能 音频与语音处理

摘要

从音乐谱面生成具有表现力的音频演奏需要模型同时捕捉乐器声学特性和人类演奏解读。传统的音乐演奏合成流程采用两阶段方法:首先从谱面生成具有表现力的MIDI,再将MIDI合成为音频。然而,合成模型常常难以在多样化的MIDI来源、音乐风格和录音环境之间泛化。为此,我们提出MIDI-VALLE,这是一种源自VALLE框架的神经编解码语言模型,VALLE最初设计用于零样本个性化文本语音合成。对于MIDI到音频的合成,我们改进了架构,使其能够依据参考音频演奏及其对应的MIDI进行条件化。与之前基于TTS的系统依赖钢琴卷帘(piano rolls)不同,MIDI-VALLE将MIDI和音频均编码为离散标记,从而更一致且稳健地建模钢琴演奏。此外,通过在大规模且多样化的钢琴演奏数据集上训练,模型的泛化能力得到提升。评估结果表明,MIDI-VALLE在ATEPP和Maestro数据集上相较于最先进的基线方法实现了超过75%的Fréchet音频距离降低。在听觉测试中,MIDI-VALLE获得了202票的评价,而基线方法仅得58票,显示其在多样化演奏MIDI输入上的合成质量和泛化能力得到显著提升。

关键词

引用

@article{arxiv.2507.08530,
  title  = {MIDI-VALLE: Improving Expressive Piano Performance Synthesis Through Neural Codec Language Modelling},
  author = {Jingjing Tang and Xin Wang and Zhe Zhang and Junichi Yamagishi and Geraint Wiggins and George Fazekas},
  journal= {arXiv preprint arXiv:2507.08530},
  year   = {2025}
}

备注

Accepted by ISMIR 2025