ASiT:用于事件分类的局部-全局音频谱图视觉Transformer
声音
2024-08-15 v2 计算机视觉与模式识别
音频与语音处理
摘要
Transformer 最初是为自然语言处理而开发的,近来因其在学习长程关系上的灵活性,在计算机视觉与音频领域引起了极大关注。受限于 Transformer 对数据的渴求特性以及标注数据的有限性,大多数基于 Transformer 的音频任务模型都是从 ImageNet 预训练模型微调而来,尽管自然图像与音频领域之间存在巨大鸿沟。这推动了音频 Transformer 自监督预训练的研究,其减少了对大量标注数据的依赖,并专注于提取音频谱图的简洁表示。本文提出局部-全局音频谱图视觉Transformer(Local-Global Audio Spectrogram vision Transformer,简称 ASiT),一种新颖的自监督学习框架,通过采用分组掩码模型学习与自蒸馏来捕获局部与全局上下文信息。我们在音频与语音分类任务上评估了预训练模型,包括音频事件分类、关键词 spotting(keyword spotting)与说话人识别。我们进一步进行了全面的消融研究,包括对不同预训练策略的评估。所提出的 ASiT 框架在所有任务上显著提升了性能,并在五项音频与语音分类任务上确立了新的 SOTA 性能,优于近期方法,包括那些使用额外数据集进行预训练的方法。
引用
@article{arxiv.2211.13189,
title = {ASiT: Local-Global Audio Spectrogram vIsion Transformer for Event Classification},
author = {Sara Atito and Muhammad Awais and Wenwu Wang and Mark D Plumbley and Josef Kittler},
journal= {arXiv preprint arXiv:2211.13189},
year = {2024}
}