从人类语音到海洋信号:迁移语音大模型用于水下声学目标识别
声音
2026-01-27 v1 音频与语音处理
摘要
水下声学目标识别(UATR)在海洋应用中发挥着至关重要的作用,但由于标记数据有限且海洋环境复杂,该任务仍具挑战性。本文探讨了一个核心问题:在海量人类语音语料上训练的语音大模型(SLM)能否有效迁移至水下声学领域?为此,我们提出 UATR-SLM,一个简单的框架,复用语音特征流水线,将 SLM 适配为声学编码器,并添加轻量级分类器。在 DeepShip 和 ShipsEar 基准上的实验表明,UATR-SLM 实现了超过 99% 的域内准确率,在不同信号长度下保持强稳健性,并在跨域评估中达到高达 96.67% 的准确率。这些结果突显了 SLM 向 UATR 的强可迁移性,为在水下声学中利用语音基础模型确立了极具前景的范式。
引用
@article{arxiv.2601.18086,
title = {From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition},
author = {Mengcheng Huang and Xue Zhou and Chen Xu and Dapeng Man},
journal= {arXiv preprint arXiv:2601.18086},
year = {2026}
}