中文

预训练SSL、ASR、LM与SLU模型在口语理解中集成的探讨

计算与语言 2022-11-17 v1 声音 音频与语音处理

摘要

为口语理解(SLU)收集充足的标注数据成本高且耗时。近期研究通过在低资源场景下使用预训练模型取得了可喜结果。受此启发,我们旨在探究:哪些(若有)预训练策略能够提升跨 SLU 基准的性能?为回答该问题,我们采用四类预训练模型及其组合用于 SLU。我们利用在大量无配对数据上自监督预训练的语音与语言模型(LM)来提取强语音与文本表征。我们还探索使用在更大型外部自动语音识别(ASR)或 SLU 语料上监督预训练的模型。我们在 SLU 评估(SLUE)基准上进行了广泛实验,观察到自监督预训练模型更为强大,其中预训练 LM 与语音模型分别对情感分析与命名实体识别任务最为有益。

关键词

引用

@article{arxiv.2211.05869,
  title  = {A Study on the Integration of Pre-trained SSL, ASR, LM and SLU Models for Spoken Language Understanding},
  author = {Yifan Peng and Siddhant Arora and Yosuke Higuchi and Yushi Ueda and Sujay Kumar and Karthik Ganesan and Siddharth Dalmia and Xuankai Chang and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2211.05869},
  year   = {2022}
}

备注

Accepted at SLT 2022