频谱图是补丁序列
声音
2022-10-31 v1 人工智能
多媒体
音频与语音处理
摘要
自监督预训练模型已在多个机器学习领域成功使用。然而,仅有极少工作与音乐相关。在我们的工作中,我们将音乐的频谱图视为一系列补丁,并设计了一个捕捉这些序列补丁特征的自监督模型:Patchifier,其充分利用了来自NLP和CV领域的自监督学习方法。我们在预训练过程中不使用标注数据,仅使用包含16k音乐片段的MTAT数据集的一个子集。预训练后,我们将该模型应用于若干下游任务。与其他音频表示模型相比,我们的模型取得了相当可接受的结果。同时,我们的工作表明将音频视为一系列补丁片段是有意义的。
引用
@article{arxiv.2210.15988,
title = {Spectrograms Are Sequences of Patches},
author = {Leyi Zhao and Yi Li},
journal= {arXiv preprint arXiv:2210.15988},
year = {2022}
}