中文

基于监督增强声学单元的改进语音预训练

音频与语音处理 2022-12-08 v1 声音

摘要

语音预训练已从大规模无标注数据中学习有用且通用的潜在表征方面展现出巨大成功。基于精心设计的自监督学习模式,预训练模型可用于服务诸多下游语音任务,如自动语音识别。为充分利用低资源任务中的标注数据,我们提出一种改进预训练方法,引入监督增强声学单元(SEAU)模式以强化上下文信息的表达并降低训练成本。从 SEAU 模式提取的编码器表征被用于为 HuBERT 预训练过程生成更具代表性的目标单元。所提方法称为 SeHuBERT,在土库曼语语音识别任务上,使用 500 小时和 100 小时微调数据时,相较于标准 HuBERT 分别实现了 10.5% 和 4.9% 的相对词错率降低。扩展到更多语言和更多数据后,SeHuBERT 还能以一半训练成本相较 HuBERT 实现约 10% 的相对词错率降低。

关键词

引用

@article{arxiv.2212.03482,
  title  = {Improved Speech Pre-Training with Supervision-Enhanced Acoustic Unit},
  author = {Pengcheng Li and Genshun Wan and Fenglin Ding and Hang Chen and Jianqing Gao and Jia Pan and Cong Liu},
  journal= {arXiv preprint arXiv:2212.03482},
  year   = {2022}
}

备注

Submitted to ICASSP 2023