中文

结合对比与非对比损失微调预训练模型用于语音分析

计算与语言 2022-11-04 v1 人工智能

摘要

嵌入副语言属性是一项具有挑战性的任务,因为在情感语音等领域仅有数小时的训练数据可用。对此问题的一个解决方案是在大量无标注语音上预训练一个通用的自监督语音表示模型,然后将该预训练模型微调到特定任务。然而,副语言属性具有众所周知的高类内方差,使得微调效果不佳。在这项工作中,我们提出一种两步方法来解决此问题。首先我们改进嵌入空间,然后训练一个适配器以弥合从嵌入空间到分类任务的差距。为了提升类不变性,我们使用对比损失与非对比损失的组合来显式优化类不变但具判别性的特征。我们的方法在多个任务上持续优于端到端微调的基线,并超越了最先进情感分类上的一个基准。

关键词

引用

@article{arxiv.2211.01964,
  title  = {Combining Contrastive and Non-Contrastive Losses for Fine-Tuning Pretrained Models in Speech Analysis},
  author = {Florian Lux and Ching-Yi Chen and Ngoc Thang Vu},
  journal= {arXiv preprint arXiv:2211.01964},
  year   = {2022}
}

备注

Accepted to IEEE SLT 2022