BYOL-S:通过自举学习自监督语音表示
声音
2022-10-26 v4 人工智能
机器学习
音频与语音处理
摘要
从几十年前频谱分析的开拓性工作起,提取音频与语音特征的方法就已被研究。近期的努力受开发通用音频表示的雄心指引。例如,深度神经网络若在大音频数据集上训练,可提取最优嵌入。本工作扩展了基于自举的自监督学习现有方法,提出了多种编码器架构,并探索使用不同预训练数据集的效果。最后,我们提出一种新颖训练框架以得到混合音频表示,结合手工特征与数据驱动学习的音频特征。所有提出的表示都在HEAR NeurIPS 2021挑战赛中的听觉场景分类与时间戳检测任务上进行了评估。我们的结果表明,以卷积transformer为编码器的混合模型在大多数HEAR挑战任务中取得更优性能。
引用
@article{arxiv.2206.12038,
title = {BYOL-S: Learning Self-supervised Speech Representations by Bootstrapping},
author = {Gasser Elbanna and Neil Scheidwasser-Clow and Mikolaj Kegler and Pierre Beckmann and Karl El Hajal and Milos Cernak},
journal= {arXiv preprint arXiv:2206.12038},
year = {2022}
}
备注
Submitted to HEAR-PMLR 2021