探究 ASR 基础模型涌现的音频分类能力
计算与语言
2024-03-29 v2
摘要
文本与视觉基础模型能够在零样本设定下执行许多任务,这一理想特性使这些系统可应用于通用及低资源场景。然而,关于 ASR 基础模型零样本能力的研究甚少,这类系统通常针对特定任务进行微调,或局限于与其训练准则和数据标注相匹配的应用。本文中,我们研究了主要用于语音识别训练的 ASR 基础模型 Whisper 与 MMS 执行零样本音频分类的能力。我们在解码器上使用基于简单模板的文本提示,并利用所得解码概率生成零样本预测。在不使用额外数据训练模型或添加任何新参数的情况下,我们证明 Whisper 在 8 个音频分类数据集上展现出有前景的零样本分类性能,其准确率较现有最先进的零样本基线平均高出 9%。释放这一涌现能力的重要一步是去偏,其中对类概率采用一种简单的无监督重加权方法可带来一致且显著的性能提升。我们进一步表明,性能随模型规模增大而提升,这意味着随着 ASR 基础模型规模扩大,它们可能展现出改进的零样本性能。
引用
@article{arxiv.2311.09363,
title = {Investigating the Emergent Audio Classification Ability of ASR Foundation Models},
author = {Rao Ma and Adian Liusie and Mark J. F. Gales and Kate M. Knill},
journal= {arXiv preprint arXiv:2311.09363},
year = {2024}
}
备注
NAACL 2024 (main conference)