用于口语理解的句子嵌入器引导话语编码器(SEGUE)
计算与语言
2023-05-23 v1 人工智能
声音
音频与语音处理
摘要
预训练的语音编码器 wav2vec 2.0 在各种口语理解(SLU)任务上表现非常好。然而,在许多任务上,它落后于具有文本输入的文本编码器。为了提升 SLU 编码器的理解能力,已有诸多研究使用知识蒸馏将自然语言理解(NLU)编码器的知识迁移过来。我们采用一种非常简单的方法,利用配对的音频-文本数据集,在预训练阶段将文本句子嵌入器的知识直接蒸馏到 wav2vec 2.0 中。我们观察到,该方法确实能够在微调设定下提升 SLU 任务性能,并且在冻结编码器上的全数据与少样本迁移中也有效。然而,该模型在某些任务上表现更差,凸显了我们方法的优势与局限。
引用
@article{arxiv.2305.12301,
title = {Sentence Embedder Guided Utterance Encoder (SEGUE) for Spoken Language Understanding},
author = {Yi Xuan Tan and Navonil Majumder and Soujanya Poria},
journal= {arXiv preprint arXiv:2305.12301},
year = {2023}
}
备注
Interspeech 2023