中文

LASER:基于语音自监督表示对齐学习以提高内容相关任务性能

计算与语言 2024-06-14 v1 声音 音频与语音处理

摘要

自监督学习(SSL)基于的语音模型在全栈语音处理中得到广泛应用。然而,人们注意到,使用无标签语音来改进 SSL 基于语音的表示以解决内容相关任务具有挑战性且计算成本高昂。近期尝试以成本效益高的自监督微调(SSFT)方法来解决此问题。沿着这一方向,本文提出了一种成本效益高的 SSFT 方法,名为 LASER:Learning by Aligning Self-supervised Representations,即通过软-DTW 对齐损失带有时间正则化项。我们使用 HuBERT 和 WavLM 模型,并在 SUPERB 基准上评估了两个内容相关任务:自动语音识别(ASR)和音素识别(PR)。实验结果表明,针对 HuBERT,ASR 和 PR 任务分别实现了 3.7% 和 8.2% 的相对改进;针对 WavLM,ASR 和 PR 任务分别实现了 4.1% 和 11.7% 的相对改进。在单个 GPU 上进行少于 3 小时的微调即可实现上述效果。

关键词

引用

@article{arxiv.2406.09153,
  title  = {LASER: Learning by Aligning Self-supervised Representations of Speech for Improving Content-related Tasks},
  author = {Amit Meghanani and Thomas Hain},
  journal= {arXiv preprint arXiv:2406.09153},
  year   = {2024}
}

备注

Accepted at Interspeech 2024