中文

基于 Transformer 的无监督预训练用于声学表征学习

音频与语音处理 2021-02-09 v3 声音

摘要

近来出现了多种声学任务及相关应用。对于许多声学任务,标注数据规模可能有限。为处理该问题,我们提出一种基于 Transformer 编码器的无监督预训练方法,以学习适用于所有声学任务的通用且鲁棒的高层表征。实验在三类声学任务上进行:语音情感识别、声音事件检测与语音翻译。所有实验均表明,使用自身训练数据预训练可显著提升性能。结合 MuST-C、Librispeech 与 ESC-US 数据集的更大量预训练数据下,语音情感识别在 IEMOCAP 数据集上 UAR 绝对提升 4.3%;声音事件检测在 DCASE2018 task5 开发集与评测集上 F1 分数分别绝对提升 1.5% 与 2.1%;语音翻译在 En-De 与 En-Fr 数据集上 BLEU 分数分别相对提升 12.2% 与 8.4%。

关键词

引用

@article{arxiv.2007.14602,
  title  = {Transformer based unsupervised pre-training for acoustic representation learning},
  author = {Ruixiong Zhang and Haiwei Wu and Wubo Li and Dongwei Jiang and Wei Zou and Xiangang Li},
  journal= {arXiv preprint arXiv:2007.14602},
  year   = {2021}
}

备注

Accepted by ICASSP 2021