音频频谱图 Transformer 的位置编码方法研究
声音
2023-10-09 v1 机器学习
音频与语音处理
摘要
Transformer 已彻底改变了深度学习的世界,尤其是在自然语言处理领域。近来,Audio Spectrogram Transformer(AST)被提出用于音频分类,在多个数据集上取得了最先进的成果。然而,为使 AST 超越 CNN,需要使用 ImageNet 进行预训练。本文中,我们研究 AST 的一个组件——位置编码,并提出若干变体以改进从头训练、无需 ImageNet 预训练的 AST 的性能。我们的最佳模型融入了条件位置编码,在 Audioset 和 ESC-50 上相比原始 AST 显著提升了性能。
引用
@article{arxiv.2110.06999,
title = {Study of positional encoding approaches for Audio Spectrogram Transformers},
author = {Leonardo Pepino and Pablo Riera and Luciana Ferrer},
journal= {arXiv preprint arXiv:2110.06999},
year = {2023}
}
备注
Submitted to ICASSP 2022. 5 pages, 3 figures