中文

ATGNN:音频标注图神经网络

声音 2023-11-06 v1 机器学习 音频与语音处理

摘要

CNN 和 Transformer 等深度学习模型已在端到端音频标注中取得令人印象深刻的性能。近期工作表明,尽管堆叠了多层,CNN 的 receptive field(感受野)仍然严重受限。另一方面,Transformer 能够通过自注意力映射全局上下文,但将谱图视为图像块序列,不足以灵活捕捉不规则音频对象。在本工作中,我们以更灵活的方式处理谱图,将其视为图结构,并用一种称为 ATGNN 的新型图神经架构进行处理。ATGNN 不仅结合了 CNN 的能力与图神经网络的全局信息共享能力,还映射了可学习类别嵌入与相应谱图区域之间的语义关系。我们在两项音频标注任务上评估了 ATGNN,其在 FSD50K 数据集上取得 0.585 mAP、在 AudioSet-balanced 数据集上取得 0.335 mAP,在以显著更少可学习参数量的情况下取得了与基于 Transformer 的模型相当的结果。

关键词

引用

@article{arxiv.2311.01526,
  title  = {ATGNN: Audio Tagging Graph Neural Network},
  author = {Shubhr Singh and Christian J. Steinmetz and Emmanouil Benetos and Huy Phan and Dan Stowell},
  journal= {arXiv preprint arXiv:2311.01526},
  year   = {2023}
}