中文

BERTphone:用于话语级说话人与语言识别的音素感知编码器表示

计算与语言 2022-01-03 v2 机器学习 声音 音频与语音处理

摘要

我们介绍了BERTphone,一种在大型语音语料库上训练的Transformer编码器,它输出音素感知的上下文表示向量,可用于说话人识别和语言识别。这是通过两个目标的训练实现的:第一个受将BERT适配到连续域的启发,涉及掩码输入帧的片段并重建整个序列以进行声学表示学习;第二个受ASR瓶颈特征成功的启发,是应用于音素标签的序列级CTC损失,用于音素表示学习。我们预训练了两个BERTphone模型(一个在Fisher上,一个在TED-LIUM上),并将它们用作x-vector风格DNN的特征提取器以用于两项任务。我们在具有挑战性的LRE07 3秒闭集语言识别任务上达到了6.16的state-of-the-art CavgC_{\text{avg}}。在Fisher和VoxCeleb说话人识别任务上,当在BERTphone向量而非MFCC上训练时,我们看到说话人EER相对降低了18%。总体而言,BERTphone在同一数据上优于先前的音素预训练方法。我们在 https://github.com/awslabs/speech-representations 发布了我们的代码和模型。

关键词

引用

@article{arxiv.1907.00457,
  title  = {BERTphone: Phonetically-Aware Encoder Representations for Utterance-Level Speaker and Language Recognition},
  author = {Shaoshi Ling and Julian Salazar and Yuzong Liu and Katrin Kirchhoff},
  journal= {arXiv preprint arXiv:1907.00457},
  year   = {2022}
}

备注

Odyssey 2020 camera-ready (presented Nov. 2020)