中文

通过自监督后训练增强音频语言模型

声音 2025-04-22 v2 机器学习 音频与语音处理

摘要

音频与文本多模态对比学习策略的研究近年来迅速受到关注。如CLAP等对比学习训练的音频语言模型(ALMs),通过在音频与语言模态之间建立统一表征,显著提升了在各种后续任务中的性能,尤其是在零样例音频分类和音频检索等方面。然而,这些模型理解自然语言和时序关系的能力仍是未被充分探索和开放的领域。本文提出一种名为TeminAL的方法,通过时序植入技术为多模态ALMs增添时序理解能力,同时不牺牲其在音频语言任务中的先天能力。我们实现了两种阶段的训练方案TeminAL A与B,其中TeminAL A中模型首先学习区分多个声音,随后在TeminAL B中植入时间概念,从而提升时序理解能力。在ESC-50数据集上,本方法在时序理解方面实现平均提升5.28%,同时在AudioCap/Clotho数据集上的零样本检索与分类任务中保持竞争力。我们还指出当前对对比式ALMs缺乏合适的评估技术,提出了在零样本设置下评估ALMs的策略。采用通用零样本模型评估策略ZSTE,可评估各种先前模型。使用TeminAL训练的模型在大多数下游任务中均超越当前模型。

关键词

引用

@article{arxiv.2408.09269,
  title  = {Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs},
  author = {Anshuman Sinha and Camille Migozzi and Aubin Rey and Chao Zhang},
  journal= {arXiv preprint arXiv:2408.09269},
  year   = {2025}
}

备注

29 pages, 15 figures