CTCBERT:以CTC目标函数推进隐单元BERT
音频与语音处理
2023-05-02 v2 声音
摘要
本文提出一种简单而有效的方法CTCBERT,用于推进隐单元BERT(HuBERT)。HuBERT采用帧级交叉熵(CE)损失,与大多数声学模型训练类似。然而,CTCBERT在每个掩码区域中去除重复ID后,以连接主义时序分类(CTC)目标函数进行模型训练。该思路源于如下观察:使用聚类或对齐ID时对齐可能存在显著误差。CTC隐式地学习对齐,表明当存在错位时以CTC学习可更具灵活性。我们在HuBERT Iter1、HuBERT Iter2与PBERT的ID上检验CTCBERT。相比CE训练,CTC训练带来了持续的改进。此外,在微调期间加载与空白相关的参数时,观察到轻微改进。在Librispeech 960-100h设定下评估,CTCBERT在test-other数据上相对HuBERT与PERT的WER相对改进为2%–11%。
引用
@article{arxiv.2210.08603,
title = {CTCBERT: Advancing Hidden-unit BERT with CTC Objectives},
author = {Ruchao Fan and Yiming Wang and Yashesh Gaur and Jinyu Li},
journal= {arXiv preprint arXiv:2210.08603},
year = {2023}
}
备注
Accepted to ICASSP2023