用于水下声学目标识别的梅尔频谱图图嵌入方法
声音
2025-12-15 v1 人工智能
摘要
由于船舶辐射噪声的复杂性和海洋环境的多变性,水下声学目标识别(UATR)极具挑战性。尽管深度学习(DL)方法取得了可喜的成果,但现有大多数模型隐式假设水下声学数据位于欧几里得空间中。然而,这一假设并不适用于水下声学信号固有的复杂拓扑结构,该结构表现出非平稳、非高斯和非线性特征。为克服这一局限性,本文提出了 UATR-GTransformer,一种将 Transformer 架构与图神经网络(GNN)相结合的非欧几里得深度学习模型。该模型包含三个关键组件:Mel patchify 模块、GTransformer 模块和分类头。Mel patchify 模块将梅尔频谱图划分为重叠的块,而 GTransformer 模块采用 Transformer 编码器捕获分割块之间的互信息以生成梅尔图嵌入。随后,GNN 通过建模局部邻域关系增强这些嵌入,前馈网络(FFN)进一步执行特征变换。基于两个广泛使用的基准数据集的实验结果表明,UATR-GTransformer 实现了与现有先进方法相媲美的性能。此外,可解释性分析表明,所提模型有效提取了丰富的频域信息,凸显了其在海洋工程中的应用潜力。
引用
@article{arxiv.2512.11545,
title = {Graph Embedding with Mel-spectrograms for Underwater Acoustic Target Recognition},
author = {Sheng Feng and Shuqing Ma and Xiaoqian Zhu},
journal= {arXiv preprint arXiv:2512.11545},
year = {2025}
}