一种基于多模态数据融合注意力增强生成对抗网络用于实时三维 underwater sound speed field 构建
声音
2026-05-05 v4 音频与语音处理
信号处理
摘要
声速剖面(SSP)是水下关键参数,决定声信号的传播模式,直接影响水下通信的能源效率和定位系统的精度。传统获取 SSP 的技术手段,如匹配场处理(MFP)、压缩感知(CS)和深度学习(DL),通常依赖现场声呐测量,给水下观测系统的部署提出了严苛要求。为克服这一限制并实现无需现场水下数据收集即可进行高精度声速场重建,我们提出一种新型多模态数据融合生成对抗网络,增强于残差注意力块(MDF-RAGAN)。该体系结构整合注意力机制有效捕获全局空间特征相关性,同时采用残差模块提取深海声速分布中由海面温度(SST)引起的细微扰动。针对公开的真实世界数据集进行实验,结果表明该模型优于其他前沿方法,估计误差小于 0.3 m/s。具体而言,MDF-RAGAN 比卷积神经网络(CNN)和空间插值(SITP)方法将均方根误差(RMSE)降低近一半,相较于均值剖面方法实现 65.8% 的 RMSE 降低。这些结果凸显了多源融合与跨模态注意力在提升声速剖面重建精度与鲁棒性方面的有效性。
引用
@article{arxiv.2507.11812,
title = {A Multimodal Data Fusion Attention-Empowered Generative Adversarial Network for Real Time 3D Underwater Sound Speed Field Construction},
author = {Wei Huang and Yuqiang Huang and Jixuan Zhou and Hao Zhang and Tianhe Xu and Qian Sun and Fang Ji},
journal= {arXiv preprint arXiv:2507.11812},
year = {2026}
}