基于大语言模型过滤器的面向代码切换语音识别的半监督学习
音频与语音处理
2024-09-23 v2
摘要
代码切换(CS)现象指的是在单个句子中交替使用来自不同语言的单词或短语。由于数据稀缺,构建有效的 CS 自动语音识别(ASR)系统仍然具有挑战性。本文提出通过利用富含大量无监督单语语音数据的半监督学习框架来增强 CS-ASR 系统,尤其是在有限获取 CS 数据的情况下。为此,我们建立了将噪声学生训练(NST)应用于 CS-ASR 任务的通用范式。具体而言,我们引入了 LLM-Filter,利用精心设计的提示模板来激活大语言模型(LLM)的纠错能力,用于单语数据选择和伪标签在 NST 期间的细化。我们的实验在受监督的 ASRU-CS 和无监督的 AISHELL-2 和 LibriSpeech 数据集上进行,表明我们的方法不仅在 CS 任务上显著优于监督和半监督学习基线,还在 CS 英文部分达到了比完全监督的 oracle 上限更好的性能。此外,我们进一步研究了语音数据中方言对 AESRC 数据集的影响,表明当单语数据包含相关语言特征时,我们的方法可获得额外的收益。
引用
@article{arxiv.2407.04219,
title = {Semi-supervised Learning for Code-Switching ASR with Large Language Model Filter},
author = {Yu Xi and Wen Ding and Kai Yu and Junjie Lai},
journal= {arXiv preprint arXiv:2407.04219},
year = {2024}
}
备注
Accepted by SLT2024