中文

SPIRE-SIES:一个自发印度英语语音语料库

音频与语音处理 2023-12-04 v1

摘要

在本文中,我们呈现一个 170.83 小时的印度英语自发语音数据集。印度英语语音数据的缺乏是开发适应印度语音风格的鲁棒语音系统的主要障碍之一。此外,自发语音方面的稀缺更为严重。该语料库通过众包方式采集,覆盖不同的印度母语背景、性别与年龄组。传统的自发语音采集策略包括在访谈或对话过程中捕获语音。在本研究中,我们使用图像作为刺激以诱导语音中的自发性。我们生成并验证了 23 小时的转写文本,可作为自发语音 ASR 基准。语料库的质量通过基于语音活动检测的分割、性别验证与图像语义相关性进行验证,其利用从 Image2Text 模型导出的描述关键词以及从 whisper ASR 生成转写中导出的高频词确定了图像刺激与所录语音之间的关系。

关键词

引用

@article{arxiv.2312.00698,
  title  = {SPIRE-SIES: A Spontaneous Indian English Speech Corpus},
  author = {Abhayjeet Singh and Charu Shah and Rajashri Varadaraj and Sonakshi Chauhan and Prasanta Kumar Ghosh},
  journal= {arXiv preprint arXiv:2312.00698},
  year   = {2023}
}

备注

6 pages, 7 plots, 3 tables, Accepted at O-COCOSDA 2023