声学少样本分类的自监督学习
声音
2025-05-16 v2 人工智能
音频与语音处理
摘要
标注数据有限,自监督学习是减少标注需求的最重要方法之一。虽然在图像领域已广泛探索,但在声学领域尚未获得相同程度的关注。然而,减少标注是许多声学应用的关键需求。特别是在生物声学领域,几乎没有足够的标签用于完全监督学习。这导致广泛使用在与生物声学任务无关的数据上预训练的声学识别器。我们认为,在实际任务数据上进行训练,结合自监督预训练和少样本分类是一种优越的方法,能够在仅有少量标签的情况下实现高精度。为此,我们引入并评估了一种新型架构,将基于CNN的预处理与基于状态空间模型(SSM)的特征提取相结合。这种结合是基于CNN的网络仅能有效捕获时序信息这一事实,而时序信息对于分类声学信号至关重要。SSM(具体而言是S4和Mamba)已被证明在捕获序列数据中的长程依赖方面表现出色。我们使用对实际任务数据进行的对比学习进行预训练,然后使用极少量标注数据进行微调。我们在标准基准数据集以及真实世界数据上评估了该架构的性能。我们的评估显示,该架构在少样本分类问题上超越了当前最先进的架构。
引用
@article{arxiv.2409.09647,
title = {Self-supervised Learning for Acoustic Few-Shot Classification},
author = {Jingyong Liang and Bernd Meyer and Isaac Ning Lee and Thanh-Toan Do},
journal= {arXiv preprint arXiv:2409.09647},
year = {2025}
}