从粗到细:音频频谱 Transformer 的高效训练
声音
2024-01-17 v1 机器学习
音频与语音处理
摘要
Transformer 已成为近期音频分类进展的核心。然而,从头训练音频频谱 Transformer(例如 AST)可能非常消耗资源和时间。此外,Transformer 的复杂性很大程度上取决于输入音频频谱图的大小。在这项工作中,我们旨在通过关联时间轴分辨率来优化 AST 训练。我们通过将 coarse-to-fine 这一开创性思想与 Transformer 模型相结合,引入了音频频谱 Transformer 的多阶段训练。为此,我们提出了一组时间压缩方法。通过采用其中一种方法,Transformer 模型在初始阶段从低分辨率(粗)数据中学习,随后在课程学习策略中使用高分辨率数据进行微调。实验结果表明,所提出的 AST 训练机制带来了更好(或持平)的性能,且收敛更快,即需要更少的计算资源和时间。这种方法也可推广到其他基于 AST 的方法,无论其学习范式如何。
引用
@article{arxiv.2401.08415,
title = {From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers},
author = {Jiu Feng and Mehmet Hamza Erol and Joon Son Chung and Arda Senocak},
journal= {arXiv preprint arXiv:2401.08415},
year = {2024}
}
备注
ICASSP 2024