中文

TRILLsson:蒸馏得到的通用副语言语音表征

音频与语音处理 2022-12-20 v2 计算与语言 机器学习 声音

摘要

自监督的最新进展显著提升了语音表征的质量。然而,由于最先进的嵌入模型公开可用性有限且资源占用大,其在设备上的部署受到限制。我们的工作通过公开发布一组体积小且性能接近最先进的副语言语音模型来解决这些问题。我们的方法基于知识蒸馏,且模型仅使用公开数据蒸馏得到。我们探索了不同架构,并在非语义语音(NOSS)基准上对我们的模型进行了充分评估。我们最大的蒸馏模型不到原始模型尺寸的15%(314MB对比2.2GB),在7项任务中的6项上达到超过96%的准确率,且训练数据量为6.5%。最小的模型尺寸为1%(22MB),在7项任务中的6项上达到超过90%的准确率。我们的模型在7项任务中的6项上优于开源的Wav2Vec 2.0模型,且我们最小的模型尽管仅为7%大小,在两项情感识别任务上均优于开源Wav2Vec 2.0。

关键词

引用

@article{arxiv.2203.00236,
  title  = {TRILLsson: Distilled Universal Paralinguistic Speech Representations},
  author = {Joel Shor and Subhashini Venugopalan},
  journal= {arXiv preprint arXiv:2203.00236},
  year   = {2022}
}

备注

Submitted to Interspeech 2022