中文

多视角更具优势:基于共生 Transformer 与多视图回归的多模态数据水下目标识别与定位

声音 2023-05-23 v1 多媒体 音频与语音处理

摘要

水下声学目标识别(UATR)与定位(UATL)在海洋探索中发挥着重要作用。高度噪声的声学信号以及多源间的时频干扰给该任务带来了巨大挑战。为应对这些问题,我们提出一种多模态方法,通过所设计的共生 Transformer(Symb-Trans)与多视图回归(MVR)方法提取并融合视听文本信息,以识别和定位水下目标。多模态数据首先由定制设计的 HetNorm 模块预处理,以在公共特征空间中归一化多源数据。Symb-Trans 模块通过并行分支与带交叉注意力机制的内容编码器对预处理后的多模态特征进行协同训练,从而嵌入视听特征。随后视听特征用于水下目标识别。同时,文本嵌入与视听特征结合输入至 MVR 模块,通过多视图聚类与多重回归预测水下目标的位置。由于尚无现成的用于 UATR 与 UATL 的多模态数据集,我们整合了多个公共数据集(包含声学、和/或视觉、和/或文本数据)以获得视听文本三元组用于模型训练与验证。实验表明,我们的模型在识别与定位任务的量化指标中分别优于对比方法的 91.7%(12 项指标中的 11 项)与 100%(4 项指标)。在案例研究中,我们通过可视化方法展示了多视图模型在建立样本可分辨性方面的优势。对于 UATL,所提出的 MVR 方法生成关系图,从而可基于具有相似条件的水下目标记录进行预测。

关键词

引用

@article{arxiv.2305.12701,
  title  = {More Perspectives Mean Better: Underwater Target Recognition and Localization with Multimodal Data via Symbiotic Transformer and Multiview Regression},
  author = {Shipei Liu and Xiaoya Fan and Guowei Wu},
  journal= {arXiv preprint arXiv:2305.12701},
  year   = {2023}
}