中文

PIAST:具有音频、符号与文本的多模态钢琴数据集

声音 2024-11-08 v2 人工智能 多媒体 音频与语音处理

摘要

虽然钢琴音乐已成为音乐信息检索(MIR)领域的重要研究课题,但目前缺乏针对钢琴独奏音乐且带有文本标签的数据集。为填补这一空白,我们提出PIAST(PIano dataset with Audio, Symbolic, and Text),即一套钢琴音乐数据集。利用钢琴专用语义标签分类体系,我们从YouTube上收集了9,673个音轨,并由音乐专家对2,023个音轨进行人工标注,形成两个子数据集:PIAST-YT和PIAST-AT。两个子数据集均包含音频、文本、标签标注以及采用最先进的钢琴转位和节拍跟踪模型转写的MIDI数据。在众多可能的多模态数据集任务中,我们使用音频和MIDI数据进行音乐标注和检索,并报告基准性能,以展示其作为MIR研究宝贵资源的潜力。

关键词

引用

@article{arxiv.2411.02551,
  title  = {PIAST: A Multimodal Piano Dataset with Audio, Symbolic and Text},
  author = {Hayeon Bang and Eunjin Choi and Megan Finch and Seungheon Doh and Seolhee Lee and Gyeong-Hoon Lee and Juhan Nam},
  journal= {arXiv preprint arXiv:2411.02551},
  year   = {2024}
}

备注

Accepted for publication at the 3rd Workshop on NLP for Music and Audio (NLP4MusA 2024)