中文

Peransformer:基于评分感知判别器改进低信息表达性表现渲染

声音 2025-10-14 v1 音频与语音处理

摘要

高度信息化表达性表现渲染(EPR)系统将带有丰富音乐注释的音符转化为类似人类的表达性演奏MIDI文件。虽然这些系统已取得令人鼓舞的成果,但与MIDI文件相比,详细音符的可用性有限且在数字音频工作站(DAW)中使用灵活性较差。最近的低信息EPR系统通过直接利用源自音符的MIDI文件作为输入,提供了更易于访问的替代方案,但这些系统往往表现次佳。此外,现有工作使用的多样化自动评估指标和数据格式,阻碍了EPR系统之间进行直接客观比较。本研究引入了Peransformer,一种基于Transformer的低信息EPR系统,旨在弥合低信息EPR系统与高度信息EPR系统之间的差距。我们的方案包含一个评分感知判别器,利用底层源自音符的MIDI文件,并在音符到演奏的配对、音符到音符对齐的MIDI数据集上进行训练。实验结果表明,Peransformer在低信息系统中实现了现代水平性能,经主观评估验证。此外,我们扩展了现有的EPR自动评估指标,提出通用EPR指标(GEM),实现对EPR系统进行更直接、准确和可靠的比较。

关键词

引用

@article{arxiv.2510.10175,
  title  = {Peransformer: Improving Low-informed Expressive Performance Rendering with Score-aware Discriminator},
  author = {Xian He and Wei Zeng and Ye Wang},
  journal= {arXiv preprint arXiv:2510.10175},
  year   = {2025}
}

备注

6 pages, 3 figures, accepted by APSIPA ASC 2025