中文

用于声学场景分类的注意力最大特征图与联合训练

机器学习 2021-12-24 v2 人工智能

摘要

各种注意力机制正被广泛应用于声学场景分类。然而,我们通过实验发现,尽管注意力机制能提升性能,却可能过度丢弃潜在有价值的信息。我们提出了注意力最大特征图,它结合了注意力与最大特征图两种有效技术,以进一步细化注意力机制并缓解上述现象。我们还探索了多种联合训练方法,包括为多段音频记录分配额外抽象标签的多任务学习。通过应用这两种提出的技术并使用相对较少的参数,我们所提出的系统在 DCASE 2020 挑战赛的 Subtask A 上展示了单系统的最先进性能。此外,采用所提出的注意力最大特征图,我们的团队在最近的 DCASE 2021 挑战赛中获得了第四名。

关键词

引用

@article{arxiv.2104.07213,
  title  = {Attentive max feature map and joint training for acoustic scene classification},
  author = {Hye-jin Shim and Jee-weon Jung and Ju-ho Kim and Ha-Jin Yu},
  journal= {arXiv preprint arXiv:2104.07213},
  year   = {2021}
}

备注

5 pages, 2 figures, 5 tables, submitted to ICASSP 2022