中文

面向轻量型Transformer关键词 spotting的自监督语音表征学习

声音 2023-03-09 v1 机器学习 音频与语音处理

摘要

自监督语音表征学习(S3RL)正在革新我们利用日益增长的数据可用性的方式。尽管S3RL相关研究通常使用大型模型,我们采用轻量型网络以符合计算受限设备的严苛内存要求。我们通过使用具有33万参数的transformers在关键词 spotting(KS)问题上展示了S3RL的有效性,并提出了一种增强语句级区分度的机制,其被证明对提升分类任务性能至关重要。在Google speech commands v2数据集上,所提方法应用于自回归预测编码S3RL相较于从头训练带来了1.2%的准确率提升。在一个包含四个不同关键词的内部KS数据集上,其在固定误拒率下提供了6%至23.7%的相对误接受改善。我们认为这证明了S3RL方法对KS轻量型模型的适用性,并确认S3RL是资源受限应用中传统监督学习的有力替代方案。

关键词

引用

@article{arxiv.2303.04255,
  title  = {Self-supervised speech representation learning for keyword-spotting with light-weight transformers},
  author = {Chenyang Gao and Yue Gu and Francesco Caliva and Yuzong Liu},
  journal= {arXiv preprint arXiv:2303.04255},
  year   = {2023}
}