预训练SSL、ASR、LM与SLU模型在口语理解中集成的探讨
计算与语言
2022-11-17 v1 声音
音频与语音处理
摘要
为口语理解(SLU)收集充足的标注数据成本高且耗时。近期研究通过在低资源场景下使用预训练模型取得了可喜结果。受此启发,我们旨在探究:哪些(若有)预训练策略能够提升跨 SLU 基准的性能?为回答该问题,我们采用四类预训练模型及其组合用于 SLU。我们利用在大量无配对数据上自监督预训练的语音与语言模型(LM)来提取强语音与文本表征。我们还探索使用在更大型外部自动语音识别(ASR)或 SLU 语料上监督预训练的模型。我们在 SLU 评估(SLUE)基准上进行了广泛实验,观察到自监督预训练模型更为强大,其中预训练 LM 与语音模型分别对情感分析与命名实体识别任务最为有益。
引用
@article{arxiv.2211.05869,
title = {A Study on the Integration of Pre-trained SSL, ASR, LM and SLU Models for Spoken Language Understanding},
author = {Yifan Peng and Siddhant Arora and Yosuke Higuchi and Yushi Ueda and Sujay Kumar and Karthik Ganesan and Siddharth Dalmia and Xuankai Chang and Shinji Watanabe},
journal= {arXiv preprint arXiv:2211.05869},
year = {2022}
}
备注
Accepted at SLT 2022