中文

低资源突尼亚方言 SLU 与 ASR 中的语音编码器性能分析

计算与语言 2024-07-10 v2 声音 音频与语音处理

摘要

通过自监督学习(SSL)预训练的语音编码器在各种下游任务中显示出卓越的性能,包括语音语言理解(SLU)和自动语音识别(ASR)。例如,针对此类任务进行SSL模型微调已显示出显著潜力,导致在具有挑战性的数据集上实现SOTA性能的提升。与现有研究不同,本文通过比较SSL方法在(i)低资源突尼亚阿拉伯方言语境以及(ii)其与低资源SLU和ASR场景的组合效果(即仅针对微调提供少量语义标注)方面的有效性来做出贡献。我们在TARIC-SLU数据集上进行了实验,使用许多SSL语音编码器。我们使用的语音编码器要么预训练于单语言语音数据,要么预训练于多语言语音数据;其中一些还通过多模态监督教师-学生范式在无领域数据且不包含突尼亚数据的情况下进行了精炼。本研究得出诸多重要发现,本文将对其进行讨论。

关键词

引用

@article{arxiv.2407.04533,
  title  = {Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect},
  author = {Salima Mdhaffar and Haroun Elleuch and Fethi Bougares and Yannick Estève},
  journal= {arXiv preprint arXiv:2407.04533},
  year   = {2024}
}

备注

Accepted in ArabicNLP 2024