中文

音频基础模型在钢琴表演评估中超越符号表示

声音 2026-01-28 v1 音频与语音处理

摘要

自动钢琴表演评估传统上依赖于符号(MIDI)表示,这些表示捕获了音符级别的信息,但缺乏描述表现性演奏所特有的声学细微差别。我提出使用预训练的音频基础模型,specifically MuQ和MERT,来预测钢琴表演质量的19个感知维度。使用通过Pianoteq渲染的PercePiano MIDI文件合成的音频,我在受控条件下比较了音频和符号方法,这些方法都来自相同的源数据。最佳模型MuQ layers 9-12配合Pianoteq soundfont增强,实现R^2 = 0.537(95%置信区间:[0.465, 0.575]),表示与符号基线(R^2 = 0.347)的55%改进。统计分析确认显著性(p < 10^-25),音频在所有19个维度上均优于符号。我通过跨soundfont泛化(R^2 = 0.534 +/- 0.075)、难度与外部数据集的相关性(rho = 0.623)以及多演奏者一致性分析来验证该方法。分析音频符号融合发现高误差相关(r = 0.738),说明为何融合几乎不提供额外好处:音频表示本身已足够。我发布了完整的训练管道、预训练模型和推理代码。

关键词

引用

@article{arxiv.2601.19029,
  title  = {Audio Foundation Models Outperform Symbolic Representations for Piano Performance Evaluation},
  author = {Jai Dhiman},
  journal= {arXiv preprint arXiv:2601.19029},
  year   = {2026}
}

备注

6 pages, 4 figures, 2 tables. Code available at https://github.com/Jai-Dhiman/crescendai