面向端到端语音到意图系统中更细粒度语音-BERT 对齐的逐词对比预训练
计算与语言
2022-07-04 v2 声音
音频与语音处理
摘要
端到端(E2E)口语语言理解(SLU)近期的进展主要归功于语音表征的有效预训练。此类预训练范式之一是将基于文本的最先进模型(如 BERT)的语义知识蒸馏至语音编码器神经网络。本工作是朝以更高效、更细粒度方式实现同样目标的一步,我们在逐词基础上对齐语音嵌入与 BERT 嵌入。我们引入一种简单而新颖的技术,使用跨模态注意力机制从语音编码器提取词级上下文嵌入,使其可直接与基于 BERT 的上下文嵌入进行比较与对齐。该对齐通过新颖的逐词对比损失实现。将此类预训练模型微调以直接利用语音执行意图识别,在两常用 SLU 数据集上取得最先进性能。当使用 SpecAugment 额外正则化微调时,我们的模型进一步提升,尤其在语音含噪时,相较先前结果绝对提升高达 8%。
引用
@article{arxiv.2204.05188,
title = {Tokenwise Contrastive Pretraining for Finer Speech-to-BERT Alignment in End-to-End Speech-to-Intent Systems},
author = {Vishal Sunder and Eric Fosler-Lussier and Samuel Thomas and Hong-Kwang J. Kuo and Brian Kingsbury},
journal= {arXiv preprint arXiv:2204.05188},
year = {2022}
}
备注
5 pages, 2 figures