中文

HTS-AT:一种用于声音分类与检测的分层令牌语义音频Transformer

声音 2022-02-03 v1 人工智能 信息检索 机器学习 音频与语音处理

摘要

音频分类是将音频样本映射至其对应标签的一项重要任务。近来,带有自注意力机制的Transformer模型已被引入该领域。然而,现有的音频Transformer需要大量GPU内存和较长训练时间,同时依赖预训练的视觉模型以获得高性能,这限制了模型在音频任务中的可扩展性。为应对这些问题,我们提出HTS-AT:一种具有分层结构以减小模型规模和训练时间的音频Transformer。它进一步结合令牌语义模块将最终输出映射为类别特征图,从而使模型能够进行音频事件检测(即时间定位)。我们在三个音频分类数据集上评估HTS-AT,其在AudioSet和ESC-50上取得了新的最先进(SOTA)结果,并在Speech Command V2上与SOTA持平。其在事件定位上也优于先前的基于CNN的模型。此外,HTS-AT仅需先前音频Transformer的35%模型参数和15%训练时间。这些结果展示了HTS-AT的高性能与高效率。

关键词

引用

@article{arxiv.2202.00874,
  title  = {HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection},
  author = {Ke Chen and Xingjian Du and Bilei Zhu and Zejun Ma and Taylor Berg-Kirkpatrick and Shlomo Dubnov},
  journal= {arXiv preprint arXiv:2202.00874},
  year   = {2022}
}

备注

Preprint version for ICASSP 2022, Singapore