中文

比较基于人类语音和动物鸣叫的自监督学习模型在生物声学处理中的表现

机器学习 2025-01-22 v2 音频与语音处理

摘要

自监督学习 (SSL) 基础模型已成为强大且领域无关的通用特征提取器,可应用于广泛的任务。预训练于人类语音的 SSL 模型在生物声学处理方面已显示出高水平的可迁移性。本文研究 (i) 基于动物鸣叫直接预训练的 SSL 模型是否优于基于语音预训练的模型,以及 (ii) 在自动语音识别 (ASR) 任务上微调语音预训练模型是否能提升生物声学分类。我们使用三个多样化的生物声学数据集和两种不同的生物声学任务进行比较分析。结果表明,基于生物声学数据预训练仅提供有限的改进,而在大多数情景下与语音预训练模型性能相当。在 ASR 任务上的微调结果呈现混合态,表明 SSL 预训练期间学习到的通用表征已然适用于生物声学任务。这些发现凸显了语音预训练 SSL 模型在生物声学中的鲁健性,并暗示在获得最佳性能时,可能并不需要广泛的微调。

关键词

引用

@article{arxiv.2501.05987,
  title  = {Comparing Self-Supervised Learning Models Pre-Trained on Human Speech and Animal Vocalizations for Bioacoustics Processing},
  author = {Eklavya Sarkar and Mathew Magimai. -Doss},
  journal= {arXiv preprint arXiv:2501.05987},
  year   = {2025}
}

备注

Accepted at ICASSP 2025