Speech SimCLR:结合对比与重构目标的自监督语音表征学习
计算与语言
2021-07-06 v2
摘要
自监督视觉预训练近期取得了显著进展。在这些方法中,SimCLR在ImageNet上的自监督和半监督学习方面大幅推进了最优水平。语音与视觉任务的输入特征表示均为连续的,因此考虑将类似目标应用于语音表征学习是自然之事。本文中,我们提出Speech SimCLR,一种用于语音表征学习的新型自监督目标。训练期间,Speech SimCLR对原始语音及其谱图施加增强。其目标是在隐空间中最大化不同增强样本间一致性的对比损失与输入表示的重构损失的组合。所提方法在语音情感识别和语音识别上取得了有竞争力的结果。
引用
@article{arxiv.2010.13991,
title = {Speech SIMCLR: Combining Contrastive and Reconstruction Objective for Self-supervised Speech Representation Learning},
author = {Dongwei Jiang and Wubo Li and Miao Cao and Wei Zou and Xiangang Li},
journal= {arXiv preprint arXiv:2010.13991},
year = {2021}
}