中文

PianoVAM:一个多模态钢琴演奏数据集

声音 2025-09-11 v1 人工智能 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

音乐演奏的多模态特性推动了音乐信息检索(MIR)社区对音频领域之外数据的日益关注。本文介绍了PianoVAM,一个综合性的钢琴演奏数据集,包括视频、音频、MIDI、手部关键点、指法标签以及丰富的元数据。该数据集使用Disklavier钢琴记录,捕获了业余钢琴师在日常练习期间的音频和MIDI,同时在真实且多变的演奏条件下同步获取顶部视角视频。手部关键点和指法标签通过预训练的手姿态估计模型和半自动指法标注算法提取。我们讨论了数据收集和跨模态对齐过程中的挑战。此外,我们描述了基于从视频中提取的手部关键点进行指法标注的方法。最后,我们在PianoVAM数据集上 presented for audio-only和audio-visual钢琴转谱的基准测试结果,并讨论了其他潜在应用。

关键词

引用

@article{arxiv.2509.08800,
  title  = {PianoVAM: A Multimodal Piano Performance Dataset},
  author = {Yonghyun Kim and Junhyung Park and Joonhyung Bae and Kirak Kim and Taegyun Kwon and Alexander Lerch and Juhan Nam},
  journal= {arXiv preprint arXiv:2509.08800},
  year   = {2025}
}

备注

Accepted to the 26th International Society for Music Information Retrieval (ISMIR) Conference, 2025