中文

在超低资源环境下创建口语对话系统

计算与语言 2023-12-12 v1 机器学习 音频与语音处理

摘要

自动语音识别(ASR)系统是一项关键技术,如今被用于设计各种应用,尤其是像 Alexa 这样的智能助手。ASR 系统本质上是对话系统,它利用口语语言理解(SLU)从语音中提取有意义的信息。设计此类系统的主要挑战在于,它们需要大量带标签的干净数据才能具有竞争力地运行,而这些数据极难收集并针对相应的 SLU 任务进行标注;此外,当为数据极其有限的低资源语言设计此类系统时,问题的严重性会加剧。在本文中,我们专注于一个相当流行的 SLU 任务,即意图分类,同时处理一种低资源语言——佛兰芒语。意图分类是一项旨在理解与系统交互的用户意图的任务。我们基于现有的佛兰芒语意图分类轻量模型进行构建,我们的主要贡献是在两个层面——语音层面和音素转录层面——对现有模型应用不同的增强技术,以应对低资源语言中带标签数据稀缺的问题。我们发现,我们的数据增强技术在两个层面上都提高了模型在多项任务上的性能。

关键词

引用

@article{arxiv.2312.06266,
  title  = {Creating Spoken Dialog Systems in Ultra-Low Resourced Settings},
  author = {Moayad Elamin and Muhammad Omer and Yonas Chanie and Henslaac Ndlovu},
  journal= {arXiv preprint arXiv:2312.06266},
  year   = {2023}
}

备注

12 pages, 15 figures