中文

基于稀疏频率正则化 Transformer 改进声音分类的域泛化

声音 2023-07-20 v1 音频与语音处理

摘要

声音分类模型在分布外(OOD)数据上的泛化性能会下降。已有众多方法被提出以帮助模型泛化。然而,大多数要么引入推理开销,要么聚焦于长久以来的 CNN 变体,而 Transformer 已被证明在众多自然语言处理与计算机视觉任务上优于 CNN。我们提出 FRITO,一种作用于 Transformer 自注意力上的有效正则化技术,通过限制谱图上各序列位置沿频率维度的注意力感受野来提升模型泛化能力。实验表明,我们的方法帮助 Transformer 模型在 TAU 2020 与 Nsynth 数据集上取得 SOTA 泛化性能,同时节省 20% 推理时间。

关键词

引用

@article{arxiv.2307.09723,
  title  = {Improving Domain Generalization for Sound Classification with Sparse Frequency-Regularized Transformer},
  author = {Honglin Mu and Wentian Xia and Wanxiang Che},
  journal= {arXiv preprint arXiv:2307.09723},
  year   = {2023}
}

备注

Accepted by ICME 2023