LHGNN:用于音频分类和标记的局部-高阶图神经网络
声音
2025-01-30 v2 人工智能
音频与语音处理
摘要
Transformer 在音频处理任务中取得了新纪录,利用自注意力机制捕捉音频数据中的复杂模式和依赖关系。然而,其仅关注二元交互,难以处理识别不同音频对象的关键的高阶关系。为此,本工作引入 Local-Higher Order Graph Neural Network (LHGNN),一种基于图的模型,通过整合局部邻域信息与来自模糊 C-Means 聚类的高阶数据,增强特征理解,捕捉更广泛的音频关系。在三个公开音频数据集上评估结果表明,LHGNN 在所有基准测试中均优于基于 Transformer 的模型,同时使用的数据参数显著更少。此外,LHGNN 在缺乏 ImageNet 预训练情境下表现出显著优势,证明其在数据资源有限的环境下的有效性与效率。
关键词
引用
@article{arxiv.2501.03464,
title = {LHGNN: Local-Higher Order Graph Neural Networks For Audio Classification and Tagging},
author = {Shubhr Singh and Emmanouil Benetos and Huy Phan and Dan Stowell},
journal= {arXiv preprint arXiv:2501.03464},
year = {2025}
}