HTS-AT:一种用于声音分类与检测的分层令牌语义音频Transformer
声音
2022-02-03 v1 人工智能
信息检索
机器学习
音频与语音处理
摘要
音频分类是将音频样本映射至其对应标签的一项重要任务。近来,带有自注意力机制的Transformer模型已被引入该领域。然而,现有的音频Transformer需要大量GPU内存和较长训练时间,同时依赖预训练的视觉模型以获得高性能,这限制了模型在音频任务中的可扩展性。为应对这些问题,我们提出HTS-AT:一种具有分层结构以减小模型规模和训练时间的音频Transformer。它进一步结合令牌语义模块将最终输出映射为类别特征图,从而使模型能够进行音频事件检测(即时间定位)。我们在三个音频分类数据集上评估HTS-AT,其在AudioSet和ESC-50上取得了新的最先进(SOTA)结果,并在Speech Command V2上与SOTA持平。其在事件定位上也优于先前的基于CNN的模型。此外,HTS-AT仅需先前音频Transformer的35%模型参数和15%训练时间。这些结果展示了HTS-AT的高性能与高效率。
引用
@article{arxiv.2202.00874,
title = {HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection},
author = {Ke Chen and Xingjian Du and Bilei Zhu and Zejun Ma and Taylor Berg-Kirkpatrick and Shlomo Dubnov},
journal= {arXiv preprint arXiv:2202.00874},
year = {2022}
}
备注
Preprint version for ICASSP 2022, Singapore