中文

频谱图是补丁序列

声音 2022-10-31 v1 人工智能 多媒体 音频与语音处理

摘要

自监督预训练模型已在多个机器学习领域成功使用。然而,仅有极少工作与音乐相关。在我们的工作中,我们将音乐的频谱图视为一系列补丁,并设计了一个捕捉这些序列补丁特征的自监督模型:Patchifier,其充分利用了来自NLP和CV领域的自监督学习方法。我们在预训练过程中不使用标注数据,仅使用包含16k音乐片段的MTAT数据集的一个子集。预训练后,我们将该模型应用于若干下游任务。与其他音频表示模型相比,我们的模型取得了相当可接受的结果。同时,我们的工作表明将音频视为一系列补丁片段是有意义的。

关键词

引用

@article{arxiv.2210.15988,
  title  = {Spectrograms Are Sequences of Patches},
  author = {Leyi Zhao and Yi Li},
  journal= {arXiv preprint arXiv:2210.15988},
  year   = {2022}
}