GraFPrint:基于图神经网络的音频识别方法
声音
2025-01-27 v2 信息检索
音频与语音处理
摘要
本文介绍了 GraFPrint,一种利用图神经网络(GNN)结构学习能力创建稳健音频指纹的音频识别框架。该方法从时频表示构建 k 近邻图(k-NN graph),并应用最大相对图卷积编码局部和全局信息。网络采用自监督对比学习方法进行训练,通过优化特征表示增强对环境干扰的鲁棒性。GraFPrint 在各种粒度级别的大规模数据集上表现出优异性能,证明其轻量且可扩展,适用于参考数据库庞大的实际应用场景。
引用
@article{arxiv.2410.10994,
title = {GraFPrint: A GNN-Based Approach for Audio Identification},
author = {Aditya Bhattacharjee and Shubhr Singh and Emmanouil Benetos},
journal= {arXiv preprint arXiv:2410.10994},
year = {2025}
}
备注
Submitted to IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)