CLAR:听觉表征的对比学习
声音
2020-10-20 v1 机器学习
音频与语音处理
摘要
使用对比自监督学习来学习丰富的视觉表征已极为成功。然而,我们能否使用类似方法来学习更优的听觉表征仍是一个主要问题。在本文中,我们基于先前的工作(SimCLR)进行扩展以学习更好的听觉表征。我们(1)引入了适用于听觉数据的各种数据增强并评估它们对预测性能的影响,(2)表明与使用原始信号相比,使用时频音频特征进行训练显著提高了所学表征的质量,以及(3)证明同时使用有监督损失和对比损失进行训练相比自监督预训练后接有监督微调能改善所学表征。我们说明,通过结合所有这些方法并使用显著更少的标注数据,我们的框架(CLAR)相比有监督方法在预测性能上取得了显著提升。此外,相比自监督方法,我们的框架收敛更快且表征显著更好。
引用
@article{arxiv.2010.09542,
title = {CLAR: Contrastive Learning of Auditory Representations},
author = {Haider Al-Tahan and Yalda Mohsenzadeh},
journal= {arXiv preprint arXiv:2010.09542},
year = {2020}
}