中文

Armor:一个用于人工音乐元评估的基准数据集

声音 2021-08-31 v1 多媒体 音频与语音处理

摘要

客观评价(OE)对人工音乐至关重要,但往往很难确定 OE 的质量。迄今为止,主观评价(SE)仍然可靠且流行,但存在 OE 可能克服的不可避免缺陷。因此,一个元评估系统对于设计者测试 OE 的有效性是必要的。在本文中,我们提出 Armor,一个复杂且跨领域的基准数据集,用于此目的。由于 OE 应与人类判断相关,我们提供音乐作为 OE 的测试用例,并提供人类判断分数作为试金石。我们还提供两种元评估场景及其相应的测试方法来评估 OE 的有效性。据我们所知,Armor 是第一个全面且严谨的框架,未来工作可以遵循、借鉴并改进它,以用于评估计算机生成音乐的任务以及整个计算音乐领域。通过在我们的数据集上分析不同的 OE 方法,我们观察到 SE 与 OE 之间仍存在巨大差距,这意味着硬编码算法远未捕捉到人类对音乐的评判。

关键词

引用

@article{arxiv.2108.12973,
  title  = {Armor: A Benchmark for Meta-evaluation of Artificial Music},
  author = {Songhe Wang and Zheng Bao and Jingtong E},
  journal= {arXiv preprint arXiv:2108.12973},
  year   = {2021}
}

备注

To appear at ACM Multimedia 2021 (8 pages, 5 figures)