Skit-S2I:一个印度口音语音到意图数据集
计算与语言
2022-12-27 v1 机器学习
声音
音频与语音处理
摘要
传统的对话助手利用自动语音识别(ASR)从语音信号中提取文本转录,然后由转录文本预测意图。使用端到端口语理解(SLU),说话者的意图直接从语音信号预测,无需中间文本转录。因此,模型可直接针对意图分类进行优化,并避免ASR的级联错误。端到端SLU系统还有助于降低意图预测模型的延迟。尽管许多文本到意图任务的公开数据集可用,但带标注的语音到意图数据集十分有限,且尚无印度口音的数据集。在本文中,我们发布了Skit-S2I数据集,这是首个公开可用的、银行领域对话语调的印度口音SLU数据集。我们进行了多个基线实验,比较了不同预训练语音编码器的表示,发现对于语音到意图分类,SSL预训练表示比缺乏韵律特征的ASR预训练表示表现略好。数据集与基线代码见\url{https://github.com/skit-ai/speech-to-intent-dataset}。
引用
@article{arxiv.2212.13015,
title = {Skit-S2I: An Indian Accented Speech to Intent dataset},
author = {Shangeth Rajaa and Swaraj Dalmia and Kumarmanas Nethil},
journal= {arXiv preprint arXiv:2212.13015},
year = {2022}
}