中文

TERA:用于语音的 Transformer 编码器表示的自监督学习

音频与语音处理 2021-08-05 v3 计算与语言 机器学习

摘要

我们引入了一种名为 TERA 的自监督语音预训练方法,代表基于改变的 Transformer 编码器表示。近期的方法通常使用单一辅助任务进行学习,如对比预测、自回归预测或掩码重建。与以往方法不同,我们沿三个正交轴使用改变策略,在大量无标签语音上预训练 Transformer 编码器。模型通过从其改变后的对应项重建声学帧来学习,其中我们使用随机策略沿不同维度进行改变:时间、频率和幅度。TERA 可用于语音表示提取或与下游模型进行微调。我们在多个下游任务上评估了 TERA,包括音素分类、关键词检测、说话人识别和语音识别。我们展示了各种自监督模型的大规模比较。通过改进表面特征并超越以往模型,TERA 在比较中取得了强劲的性能。在我们的实验中,我们研究了应用不同改变技术、在更多数据上预训练以及在不同特征上预训练的效果。我们分析了不同模型大小,发现较小的模型比较大的模型是更强的表示学习器,而较大的模型在下游微调中比较小的模型更有效。此外,我们表明所提方法可迁移至预训练中未使用的下游数据集。

关键词

引用

@article{arxiv.2007.06028,
  title  = {TERA: Self-Supervised Learning of Transformer Encoder Representation for Speech},
  author = {Andy T. Liu and Shang-Wen Li and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2007.06028},
  year   = {2021}
}

备注

Published in IEEE/ACM TASLP, final published article available at https://ieeexplore.ieee.org/document/9478264