面向通用音频表征的自然语言监督
声音
2024-02-08 v2 音频与语音处理
摘要
音频-语言模型联合学习多模态文本与音频表征,从而实现零样本推理。模型依赖于编码器来创建输入的有力表征,并泛化到涵盖声音、音乐与语音的多种任务。尽管模型已取得令人瞩目的性能,其与任务专用模型之间仍存在性能差距。本文中,我们提出一种对比语言-音频预训练模型,该模型以 460 万音频-文本对多样化集合进行预训练,并采用两个创新编码器以实现零样本推理。为学习音频表征,我们在 22 个音频任务上训练音频编码器,而非标准的声音事件分类训练。为学习语言表征,我们训练了一个自回归仅解码器模型,而非标准的仅编码器模型。随后,利用对比学习将音频与语言表征带入联合多模态空间。我们使用所提编码器以一定幅度提升下游性能。我们在 26 个下游任务上广泛评估了表征的泛化性,为文献中最大规模。我们的模型在若干任务上取得最先进结果,为通向通用音频表征铺平道路。
引用
@article{arxiv.2309.05767,
title = {Natural Language Supervision for General-Purpose Audio Representations},
author = {Benjamin Elizalde and Soham Deshmukh and Huaming Wang},
journal= {arXiv preprint arXiv:2309.05767},
year = {2024}
}