以离散单元作为中间目标改进无文本口语理解
计算与语言
2023-07-11 v2 音频与语音处理
摘要
口语理解(Spoken Language Understanding, SLU)是一项旨在从口语话语中提取语义信息的任务。先前的研究通过使用配对语音-文本数据(如预训练的自动语音识别(Automatic Speech Recognition, ASR)模型或配对文本作为中间目标)在端到端 SLU 方面取得了进展。然而,获取配对转录文本成本高昂,且对于无文字语言而言不切实际。另一方面,无文本 SLU(Textless SLU)在不利用配对转录文本的情况下从语音中提取语义信息。然而,无文本 SLU 缺乏中间目标与训练指导,常导致次优性能。在本工作中,受自监督语音模型中内容解耦的离散单元启发,我们提出使用离散单元作为中间指导以提升无文本 SLU 性能。我们的方法在五个 SLU 基准语料库上超越了基线方法。此外,我们发现单元指导有助于少样本学习,并增强模型处理噪声的能力。
引用
@article{arxiv.2305.18096,
title = {Improving Textless Spoken Language Understanding with Discrete Units as Intermediate Target},
author = {Guan-Wei Wu and Guan-Ting Lin and Shang-Wen Li and Hung-yi Lee},
journal= {arXiv preprint arXiv:2305.18096},
year = {2023}
}
备注
Accepted by Interspeech 2023. *Equal contribution