中文

SLURP-TN:面向突尼尔方言口语理解的数据集

计算与语言 2026-03-24 v1

摘要

口语理解 (SLU) 旨在从用户查询的语音语料中提取语义信息,是任务导向对话系统的核心组件。随着深度神经网络模型的飞速进步和预训练语言模型的演变,SLU 取得了显著的突破。然而,由于缺乏 SLU 资源,只有少数高资源语言才能受益于这一进展。本文通过引入 SLURP-TN 来缓解这一障碍。该数据集由 55 名 native speaker 记录其说的突尼尔方言句子而成,这些句子经手动翻译自六个 SLURP 领域。结果是一个包含 4165 句记录约 5 小时语音材料的突尼尔方言 SLU 数据集。我们还开发了多个自动语音识别和 SLU 模型,利用 SLUTP-TN。数据集和基线模型已公开:https://huggingface.co/datasets/Elyadata/SLURP-TN。

关键词

引用

@article{arxiv.2603.21940,
  title  = {SLURP-TN : Resource for Tunisian Dialect Spoken Language Understanding},
  author = {Haroun Elleuch and Salima Mdhaffar and Yannick Estève and Fethi Bougares},
  journal= {arXiv preprint arXiv:2603.21940},
  year   = {2026}
}

备注

Accepted at LREC 2026