利用大规模训练Patchout音频Transformer学习通用音频表示
声音
2023-03-03 v2 机器学习
音频与语音处理
摘要
有监督深度学习方法之所以成功,很大程度上归功于其从原始数据学习相关特征的能力。在大规模数据集上训练的深度神经网络(DNNs)能够捕获多样化特征,并学习可泛化到来自同一领域的未见任务与数据集的表示。因此,这些模型可作为强大的特征提取器,与较浅的分类器模型结合,用于训练数据不足以从头学习端到端模型的小型任务与数据集。过去几年中,卷积神经网络(CNNs)在很大程度上是音频处理的首选方法。然而,近期基于注意力的Transformer模型在有监督设定中展现出巨大潜力,性能超越CNNs。本工作中,我们研究在大规模数据集上训练的音频Transformer以学习通用表示。我们研究这些音频Transformer中不同设定如何影响其嵌入质量。我们实验考察模型的时间分辨率、提取的嵌入层级与感受野,以观察它们如何在各类任务与数据集上影响性能,遵循HEAR 2021 NeurIPS挑战赛评估设定。结果表明,音频Transformer提取的表示优于CNN表示。此外,我们将展示在Audioset上训练的Transformer可作为广泛下游任务极其有效的表示提取器。
引用
@article{arxiv.2211.13956,
title = {Learning General Audio Representations with Large-Scale Training of Patchout Audio Transformers},
author = {Khaled Koutini and Shahed Masoudian and Florian Schmid and Hamid Eghbal-zadeh and Jan Schlüter and Gerhard Widmer},
journal= {arXiv preprint arXiv:2211.13956},
year = {2023}
}
备注
will apear in HEAR: Holistic Evaluation of Audio Representations Proceedings of Machine Learning Research PMLR 166. Source code: https://github.com/kkoutini/passt_hear21