Underwater-Art: 利用文本模板拓展信息视角的水下声学目标识别
声音
2024-02-20 v2 机器学习
音频与语音处理
摘要
由于复杂的声源特性与声音传播模式,水下声学目标识别是一项艰巨任务。受限于数据不足与信息视角狭窄,基于深度学习的识别模型在实际水下场景中远不能令人满意。尽管水下声学信号受到距离、信道深度或其他因素的严重影响,相关信息的标注往往不统一、不完整且难以利用。在我们的工作中,我们提出基于由丰富相关信息构成的模板来实现水下声学识别(以下简称 "UART")。我们设计模板将不同视角的相关信息整合为描述性自然语言。UART 采用音频-谱图-文本三模态对比学习框架,赋予 UART 以描述性自然语言引导声学表征学习的能力。我们的实验表明,UART 比传统范式具有更好的识别能力与泛化性能。此外,预训练的 UART 模型可在无任何辅助标注的场景下为识别模型提供优越的先验知识。
引用
@article{arxiv.2305.19612,
title = {Underwater-Art: Expanding Information Perspectives With Text Templates For Underwater Acoustic Target Recognition},
author = {Yuan Xie and Jiawei Ren and Ji Xu},
journal= {arXiv preprint arXiv:2305.19612},
year = {2024}
}