中文

基于音频对比的微调:解耦表示学习与分类

声音 2025-09-23 v4 人工智能 计算与语言 音频与语音处理

摘要

预训练音频模型的标准微调将表示学习与分类器训练相耦合,这可能掩盖所学表示的真实质量。本文主张采用解耦的两阶段框架,将表示精炼与下游评估分离。首先,我们采用“对比微调”阶段显式改善模型嵌入空间的几何结构。随后,我们引入双探针评估协议,从几何角度评估这些精炼表示的质量。该协议使用线性探针度量全局线性可分性,并使用k近邻探针考察类簇的局部结构。我们在多样化音频分类任务上的实验表明,我们的框架为分类提供了更好的基础,带来准确率提升。我们新提出的双探针框架充当强大的分析透镜,通过揭示更优的嵌入空间说明了对比学习为何更有效。它在单标签且类别数多的数据集上显著优于朴素微调,并在使用Jaccard加权损失的多标签任务上超越强基线。我们的发现表明,将表示精炼与分类器训练解耦是释放预训练音频模型全部潜力的广泛有效策略。我们的代码将公开可用。

关键词

引用

@article{arxiv.2309.11895,
  title  = {Audio Contrastive-based Fine-tuning: Decoupling Representation Learning and Classification},
  author = {Yang Wang and Qibin Liang and Chenghao Xiao and Yizhi Li and Noura Al Moubayed and Chenghua Lin},
  journal= {arXiv preprint arXiv:2309.11895},
  year   = {2025}
}

备注

This paper has been submitted to ICASSP 2026 and is currently under review