中文

基于Patchout谱图Transformer改进的零样本音频标注与分类

声音 2022-08-25 v1 机器学习 音频与语音处理 信号处理

摘要

用于音频信号标注与分类的标准机器学习模型无法处理训练期间未见的类别。零样本(ZS)学习通过基于可适配的类别描述进行预测克服了这一限制。本研究旨在探讨基于自注意力的音频嵌入架构对于ZS学习的有效性。为此,我们将最新的patchout谱图transformer与两种经典卷积架构进行比较。我们在三项任务和三个不同基准数据集上评估这三种架构:AudioSet上的通用标注、ESC-50上的环境声音分类,以及OpenMIC上的乐器标注。我们的结果显示,基于自注意力的嵌入方法在所有这些设定下均优于所比较的两种卷积架构。通过相应地设计训练与测试数据,我们观察到当训练类别与新的测试类别之间的“语义距离”较大时,预测性能显著下降,这一效应值得更细致的研究。

关键词

引用

@article{arxiv.2208.11402,
  title  = {Improved Zero-Shot Audio Tagging & Classification with Patchout Spectrogram Transformers},
  author = {Paul Primus and Gerhard Widmer},
  journal= {arXiv preprint arXiv:2208.11402},
  year   = {2022}
}

备注

published in EUSIPCO 2022