基于 Transformer 网络与自监督预训练特征的端到端口语理解
计算与语言
2020-11-18 v1 声音
音频与语音处理
摘要
Transformer 网络与自监督预训练在自然语言处理(NLP)领域持续给出最先进的结果;然而,它们在口语理解(SLU)领域的价值仍需要进一步研究。在本文中,我们引入了一种基于模块化端到端(E2E)SLU Transformer 网络的架构,其允许使用自监督预训练声学特征、预训练模型初始化与多任务训练。使用 ATIS 数据集进行了若干用于预测意图与实体标签/值的 SLU 实验。这些实验研究了预训练模型初始化与多任务训练同传统 filterbank 或自监督预训练声学特征之间的相互作用。结果表明,不仅自监督预训练声学特征在几乎所有实验中均优于 filterbank 特征,而且当这些特征与多任务训练结合使用时,它们几乎消除了对预训练模型初始化的需求。
引用
@article{arxiv.2011.08238,
title = {End-to-end spoken language understanding using transformer networks and self-supervised pre-trained features},
author = {Edmilson Morais and Hong-Kwang J. Kuo and Samuel Thomas and Zoltan Tuske and Brian Kingsbury},
journal= {arXiv preprint arXiv:2011.08238},
year = {2020}
}
备注
5 pages, 3 tables and 1 figure