中文

Skit-S2I:一个印度口音语音到意图数据集

计算与语言 2022-12-27 v1 机器学习 声音 音频与语音处理

摘要

传统的对话助手利用自动语音识别(ASR)从语音信号中提取文本转录,然后由转录文本预测意图。使用端到端口语理解(SLU),说话者的意图直接从语音信号预测,无需中间文本转录。因此,模型可直接针对意图分类进行优化,并避免ASR的级联错误。端到端SLU系统还有助于降低意图预测模型的延迟。尽管许多文本到意图任务的公开数据集可用,但带标注的语音到意图数据集十分有限,且尚无印度口音的数据集。在本文中,我们发布了Skit-S2I数据集,这是首个公开可用的、银行领域对话语调的印度口音SLU数据集。我们进行了多个基线实验,比较了不同预训练语音编码器的表示,发现对于语音到意图分类,SSL预训练表示比缺乏韵律特征的ASR预训练表示表现略好。数据集与基线代码见\url{https://github.com/skit-ai/speech-to-intent-dataset}。

关键词

引用

@article{arxiv.2212.13015,
  title  = {Skit-S2I: An Indian Accented Speech to Intent dataset},
  author = {Shangeth Rajaa and Swaraj Dalmia and Kumarmanas Nethil},
  journal= {arXiv preprint arXiv:2212.13015},
  year   = {2022}
}