中文

匹配致胜:语音与音频中高效自监督学习的序列长度分析

声音 2022-11-23 v4 机器学习 音频与语音处理

摘要

自监督学习(SSL)已被证明在语音和音频相关应用中至关重要。该范式在未标记数据上训练通用模型,之后可用于解决特定下游任务。此类模型训练成本高昂,因为需要处理长输入序列,而这只能由强大的中心化服务器处理。令人惊讶的是,尽管许多研究试图通过模型压缩来提高训练效率,但截断输入序列长度以减少计算的影响尚未被研究。在本文中,我们首次对不同指定序列长度的SSL预训练进行了实证研究,并将其与各种下游任务联系起来。我们发现,在短序列上训练可以显著降低资源成本,同时对所有任务保持令人满意的性能。这一简单的一行代码改动将促进SSL训练从数据中心向用户端边缘设备迁移,以实现更真实和个性化的应用。

关键词

引用

@article{arxiv.2209.15575,
  title  = {Match to Win: Analysing Sequences Lengths for Efficient Self-supervised Learning in Speech and Audio},
  author = {Yan Gao and Javier Fernandez-Marques and Titouan Parcollet and Pedro P. B. de Gusmao and Nicholas D. Lane},
  journal= {arXiv preprint arXiv:2209.15575},
  year   = {2022}
}