中文

BYOL-S:通过自举学习自监督语音表示

声音 2022-10-26 v4 人工智能 机器学习 音频与语音处理

摘要

从几十年前频谱分析的开拓性工作起,提取音频与语音特征的方法就已被研究。近期的努力受开发通用音频表示的雄心指引。例如,深度神经网络若在大音频数据集上训练,可提取最优嵌入。本工作扩展了基于自举的自监督学习现有方法,提出了多种编码器架构,并探索使用不同预训练数据集的效果。最后,我们提出一种新颖训练框架以得到混合音频表示,结合手工特征与数据驱动学习的音频特征。所有提出的表示都在HEAR NeurIPS 2021挑战赛中的听觉场景分类与时间戳检测任务上进行了评估。我们的结果表明,以卷积transformer为编码器的混合模型在大多数HEAR挑战任务中取得更优性能。

关键词

引用

@article{arxiv.2206.12038,
  title  = {BYOL-S: Learning Self-supervised Speech Representations by Bootstrapping},
  author = {Gasser Elbanna and Neil Scheidwasser-Clow and Mikolaj Kegler and Pierre Beckmann and Karl El Hajal and Milos Cernak},
  journal= {arXiv preprint arXiv:2206.12038},
  year   = {2022}
}

备注

Submitted to HEAR-PMLR 2021