中文

低资源条件下预训练音频编码器的研究

计算与语言 2023-05-30 v1 声音 音频与语音处理

摘要

预训练语音编码器在推动各类语音理解与生成任务的最先进结果方面一直处于核心地位。然而,这些编码器在低资源环境下的能力尚待深入探究。为此,我们在低资源设置下,针对 7 项语音理解与生成任务,使用一组具代表性的 3 种最先进编码器(Wav2vec2、WavLM、Whisper)开展了一系列全面实验。我们对任务性能、收敛速度以及编码器的表征特性提供了多种定量与定性分析。我们观察到这些编码器的预训练协议与其内部层捕获信息的方式之间存在关联。具体而言,我们观察到 Whisper 编码器在内容驱动任务上于性能与收敛速度方面展现出最强的低资源能力。

关键词

引用

@article{arxiv.2305.17733,
  title  = {Investigating Pre-trained Audio Encoders in the Low-Resource Condition},
  author = {Hao Yang and Jinming Zhao and Gholamreza Haffari and Ehsan Shareghi},
  journal= {arXiv preprint arXiv:2305.17733},
  year   = {2023}
}

备注

INTERSPEECH 2023