ST-BERT:面向端到端口语理解的跨模态语言模型预训练
计算与语言
2021-04-13 v2 机器学习
摘要
语言模型预训练在各种下游任务中已显示出有前景的结果。在此背景下,我们引入一种跨模态预训练语言模型,称为Speech-Text BERT(ST-BERT),以应对端到端口语理解(E2E SLU)任务。ST-BERT以音素后验和子词级文本作为输入,通过我们提出的两个预训练任务——跨模态掩码语言建模(CM-MLM)和跨模态条件语言建模(CM-CLM)——学习上下文化跨模态对齐。在三个基准上的实验结果表明,我们的方法对各种SLU数据集均有效,并且即使在仅可用1%训练数据时也表现出令人惊讶的微小性能下降。此外,我们的方法通过利用特定领域语音-文本对数据进行领域自适应预训练,展现出进一步的SLU性能提升。
引用
@article{arxiv.2010.12283,
title = {ST-BERT: Cross-modal Language Model Pre-training For End-to-end Spoken Language Understanding},
author = {Minjeong Kim and Gyuwan Kim and Sang-Woo Lee and Jung-Woo Ha},
journal= {arXiv preprint arXiv:2010.12283},
year = {2021}
}
备注
ICASSP 2021; 5 pages