中文

SPEECH-COCO:与 MSCOCO 数据集对齐的 60 万条视觉基础口语字幕

计算与语言 2020-11-24 v5

摘要

本文提出了对 MSCOCO 数据集的增强,其中在图像和文本之外加入了语音。语音字幕通过文本转语音(TTS)合成生成,产生了 616,767 条口语字幕(超过 600 小时)并与图像配对。为了使声音更自然,信号中加入了不流利现象和速度扰动。每个语音信号(WAV)都与一个 JSON 文件配对,该文件包含口语字幕中每个词/音节/音素的精确时间码。此类语料库可用于包含语音输入或输出(而非文本)的语言与视觉(LaVi)任务。利用该语料库研究无监督语音模式发现的多模态学习方案也是可行的,正如在语料库子集(10 小时,1 万条口语字幕)上进行的初步研究所展示的那样。该数据集可在 Zenodo 上获取:https://zenodo.org/record/4282267

关键词

引用

@article{arxiv.1707.08435,
  title  = {SPEECH-COCO: 600k Visually Grounded Spoken Captions Aligned to MSCOCO Data Set},
  author = {William Havard and Laurent Besacier and Olivier Rosec},
  journal= {arXiv preprint arXiv:1707.08435},
  year   = {2020}
}

备注

Data set available on https://zenodo.org/record/4282267. Presented at GLU (Grounded Language Understanding) Satellite Workshop of Interspeech 2017