ElasticAST:面向任意长度与分辨率的音频声谱 Transformer
声音
2024-07-12 v1 人工智能
音频与语音处理
摘要
Transformer 正快速取代 CNN 架构成为音频分类的新标准。基于 Transformer 的模型(如 Audio Spectrogram Transformers, AST)也继承了固定大小输入的范式,这导致在输入长度从训练到推理过程中变化时,AST 的性能下降。本文提出一种方法,使 AST 模型在训练和推理期间均能使用可变长音频输入。通过采用序列打包策略,ElasticAST 在训练期间能够适应任意音频长度,从而在推理时实现对所有长度和分辨率的灵活性。这种灵活性使 ElasticAST 能够在各种长度或分辨率下保持评估能力,并在性能上与在特定长度或分辨率训练的标准 AST 相当。此外,实验表明,ElasticAST 在训练和评估本地长音频数据集时表现更佳。
引用
@article{arxiv.2407.08691,
title = {ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions},
author = {Jiu Feng and Mehmet Hamza Erol and Joon Son Chung and Arda Senocak},
journal= {arXiv preprint arXiv:2407.08691},
year = {2024}
}
备注
Interspeech 2024. Code is available at https://github.com/JiuFengSC/ElasticAST