自监督语音模型用于音频表征的有效性
声音
2023-02-01 v3 人工智能
计算与语言
音频与语音处理
摘要
自监督学习(self-supervised learning, SSL)语音模型可作为强大的上游模型来提取有意义的语音表征,已在语音表征学习中取得前所未有的成功。然而,它们在非语音数据集上的有效性相对较少被探索。本文中,我们提出一种集成框架,结合多种集成技术来融合 SSL 语音模型的嵌入表示。我们在语音与非语音音频数据集上进行了大量实验,以研究我们集成方法及其单一组成模型的表征能力。我们开展了消融实验来评估不同集成技术(如特征平均与拼接)的性能。所有实验均在 NeurIPS 2021 HEAR 挑战赛期间作为竞赛官方提供的标准评估流程进行。结果表明 SSL 语音模型在各种非语音任务上具有强大能力,同时我们也注意到它们难以处理细粒度音乐任务,如音高分类与音符起音检测。此外,特征集成在生成更整体的表征方面展现出巨大潜力,因为我们提出的框架普遍超越了 SOTA SSL 语音/音频模型,并在 HEAR 挑战赛中各数据集上相较其他队伍具有更优性能。我们的代码可在 https://github.com/tony10101105/HEAR-2021-NeurIPS-Challenge -- NTU-GURA 获取。
引用
@article{arxiv.2209.12900,
title = {The Efficacy of Self-Supervised Speech Models for Audio Representations},
author = {Tung-Yu Wu and Chen-An Li and Tzu-Han Lin and Tsu-Yuan Hsu and Hung-Yi Lee},
journal= {arXiv preprint arXiv:2209.12900},
year = {2023}
}
备注
to appear in Proceedings of Machine Learning Research (PMLR): NeurIPS 2021 Competition Track