中文

Underwater-Art: 利用文本模板拓展信息视角的水下声学目标识别

声音 2024-02-20 v2 机器学习 音频与语音处理

摘要

由于复杂的声源特性与声音传播模式,水下声学目标识别是一项艰巨任务。受限于数据不足与信息视角狭窄,基于深度学习的识别模型在实际水下场景中远不能令人满意。尽管水下声学信号受到距离、信道深度或其他因素的严重影响,相关信息的标注往往不统一、不完整且难以利用。在我们的工作中,我们提出基于由丰富相关信息构成的模板来实现水下声学识别(以下简称 "UART")。我们设计模板将不同视角的相关信息整合为描述性自然语言。UART 采用音频-谱图-文本三模态对比学习框架,赋予 UART 以描述性自然语言引导声学表征学习的能力。我们的实验表明,UART 比传统范式具有更好的识别能力与泛化性能。此外,预训练的 UART 模型可在无任何辅助标注的场景下为识别模型提供优越的先验知识。

关键词

引用

@article{arxiv.2305.19612,
  title  = {Underwater-Art: Expanding Information Perspectives With Text Templates For Underwater Acoustic Target Recognition},
  author = {Yuan Xie and Jiawei Ren and Ji Xu},
  journal= {arXiv preprint arXiv:2305.19612},
  year   = {2024}
}