中文

用于音效库自动索引的表示学习

声音 2022-08-22 v1 机器学习 音频与语音处理

摘要

对商业音效库进行标注与维护是一项耗时的工作,而数据库规模持续增长并经历分类体系更新更使之雪上加霜。此外,即便在引入新行业标准通用类别系统(Universal Category System)后,非统一元数据这一顽固问题仍使声音检索与分类体系创建复杂化。为解决这些问题并克服阻碍深度学习模型成功训练的数据集相关局限,我们致力于表示学习,以训练可用于各类音效库且作为与分类体系无关的声学表示的通用嵌入。我们表明,一种特定任务但独立于数据集的表示能够成功应对类不平衡、类标签不一致及数据集规模不足等数据问题,并优于 OpenL3 等已有表示。详尽的实验结果显示了度量学习方法与不同跨数据集训练方式对表示有效性的影响。

关键词

引用

@article{arxiv.2208.09096,
  title  = {Representation Learning for the Automatic Indexing of Sound Effects Libraries},
  author = {Alison B. Ma and Alexander Lerch},
  journal= {arXiv preprint arXiv:2208.09096},
  year   = {2022}
}

备注

Accepted at the 23rd International Society for Music Information Retrieval Conference (ISMIR 2022), 10 pages, 7 figures