中文

GraFPrint:基于图神经网络的音频识别方法

声音 2025-01-27 v2 信息检索 音频与语音处理

摘要

本文介绍了 GraFPrint,一种利用图神经网络(GNN)结构学习能力创建稳健音频指纹的音频识别框架。该方法从时频表示构建 k 近邻图(k-NN graph),并应用最大相对图卷积编码局部和全局信息。网络采用自监督对比学习方法进行训练,通过优化特征表示增强对环境干扰的鲁棒性。GraFPrint 在各种粒度级别的大规模数据集上表现出优异性能,证明其轻量且可扩展,适用于参考数据库庞大的实际应用场景。

关键词

引用

@article{arxiv.2410.10994,
  title  = {GraFPrint: A GNN-Based Approach for Audio Identification},
  author = {Aditya Bhattacharjee and Shubhr Singh and Emmanouil Benetos},
  journal= {arXiv preprint arXiv:2410.10994},
  year   = {2025}
}

备注

Submitted to IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)