ATGNN:音频标注图神经网络
声音
2023-11-06 v1 机器学习
音频与语音处理
摘要
CNN 和 Transformer 等深度学习模型已在端到端音频标注中取得令人印象深刻的性能。近期工作表明,尽管堆叠了多层,CNN 的 receptive field(感受野)仍然严重受限。另一方面,Transformer 能够通过自注意力映射全局上下文,但将谱图视为图像块序列,不足以灵活捕捉不规则音频对象。在本工作中,我们以更灵活的方式处理谱图,将其视为图结构,并用一种称为 ATGNN 的新型图神经架构进行处理。ATGNN 不仅结合了 CNN 的能力与图神经网络的全局信息共享能力,还映射了可学习类别嵌入与相应谱图区域之间的语义关系。我们在两项音频标注任务上评估了 ATGNN,其在 FSD50K 数据集上取得 0.585 mAP、在 AudioSet-balanced 数据集上取得 0.335 mAP,在以显著更少可学习参数量的情况下取得了与基于 Transformer 的模型相当的结果。
引用
@article{arxiv.2311.01526,
title = {ATGNN: Audio Tagging Graph Neural Network},
author = {Shubhr Singh and Christian J. Steinmetz and Emmanouil Benetos and Huy Phan and Dan Stowell},
journal= {arXiv preprint arXiv:2311.01526},
year = {2023}
}