中文

VisionScores——面向深度学习任务的系统分段图像评分数据集

计算机视觉与模式识别 2025-07-01 v1 人工智能 机器学习 声音 音频与语音处理

摘要

VisionScores 提出了首个系统分段图像评分数据集,旨在为机器学习和深度学习任务提供结构丰富、信息密度高的图像。其局限于两手钢琴作品,既考虑特定的图形相似性,也考虑作品构图模式,因为这一创作过程高度依赖乐器。数据集提供两种情形:一种由14000个样本构成,涉及不同作者但相同作品类型(即小品曲);另一种由10800个样本构成,涉及同一作者(选定为弗朗茨·李斯茨)的不同作品类型。所有24800个样本均以灰度 JPG 图像格式呈现,尺寸为 128×512128 \times 512 像素。VisionScores 不仅提供格式化的样本,还提供系统排序和作品元数据。此外,还包含未分段的整页乐谱及预格式化图像,以供进一步分析。

关键词

引用

@article{arxiv.2506.23030,
  title  = {VisionScores -- A system-segmented image score dataset for deep learning tasks},
  author = {Alejandro Romero Amezcua and Mariano José Juan Rivera Meraz},
  journal= {arXiv preprint arXiv:2506.23030},
  year   = {2025}
}

备注

Comments: 5 pages, 3 figures. Accepted for presentation at the 2025 IEEE International Conference on Image Processing (ICIP). \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for any other use