中文

CTCBERT:以CTC目标函数推进隐单元BERT

音频与语音处理 2023-05-02 v2 声音

摘要

本文提出一种简单而有效的方法CTCBERT,用于推进隐单元BERT(HuBERT)。HuBERT采用帧级交叉熵(CE)损失,与大多数声学模型训练类似。然而,CTCBERT在每个掩码区域中去除重复ID后,以连接主义时序分类(CTC)目标函数进行模型训练。该思路源于如下观察:使用聚类或对齐ID时对齐可能存在显著误差。CTC隐式地学习对齐,表明当存在错位时以CTC学习可更具灵活性。我们在HuBERT Iter1、HuBERT Iter2与PBERT的ID上检验CTCBERT。相比CE训练,CTC训练带来了持续的改进。此外,在微调期间加载与空白相关的参数时,观察到轻微改进。在Librispeech 960-100h设定下评估,CTCBERT在test-other数据上相对HuBERT与PERT的WER相对改进为2%–11%。

关键词

引用

@article{arxiv.2210.08603,
  title  = {CTCBERT: Advancing Hidden-unit BERT with CTC Objectives},
  author = {Ruchao Fan and Yiming Wang and Yashesh Gaur and Jinyu Li},
  journal= {arXiv preprint arXiv:2210.08603},
  year   = {2023}
}

备注

Accepted to ICASSP2023