中文

用于口语理解的句子嵌入器引导话语编码器(SEGUE)

计算与语言 2023-05-23 v1 人工智能 声音 音频与语音处理

摘要

预训练的语音编码器 wav2vec 2.0 在各种口语理解(SLU)任务上表现非常好。然而,在许多任务上,它落后于具有文本输入的文本编码器。为了提升 SLU 编码器的理解能力,已有诸多研究使用知识蒸馏将自然语言理解(NLU)编码器的知识迁移过来。我们采用一种非常简单的方法,利用配对的音频-文本数据集,在预训练阶段将文本句子嵌入器的知识直接蒸馏到 wav2vec 2.0 中。我们观察到,该方法确实能够在微调设定下提升 SLU 任务性能,并且在冻结编码器上的全数据与少样本迁移中也有效。然而,该模型在某些任务上表现更差,凸显了我们方法的优势与局限。

关键词

引用

@article{arxiv.2305.12301,
  title  = {Sentence Embedder Guided Utterance Encoder (SEGUE) for Spoken Language Understanding},
  author = {Yi Xuan Tan and Navonil Majumder and Soujanya Poria},
  journal= {arXiv preprint arXiv:2305.12301},
  year   = {2023}
}

备注

Interspeech 2023