中文

YFACC:用于通过视觉接地实现跨语言关键词定位的约鲁巴语语音-图像数据集

计算与语言 2022-10-13 v2 音频与语音处理

摘要

视觉接地语音(VGS)模型在图像与无标签语音字幕配对数据上训练。此类模型可用于在无法获取标注数据的场景中构建语音系统,例如记录无文字语言。然而,多数 VGS 研究基于英语或其他高资源语言。本文试图弥补这一不足。我们收集并发布了一个新的单说话人约鲁巴语(尼日利亚使用的真实低资源语言)6k Flickr 图像音频字幕数据集。我们训练了一个基于注意力的 VGS 模型,其中图像自动用英语视觉标签标注并与约鲁巴语话语配对。这使得跨语言关键词定位成为可能:在英语书面查询在约鲁巴语语音中被检测并定位。为量化较小数据集的影响,我们与在相似及更多数据上训练的英语系统进行比较。我们希望该新数据集能激发将 VGS 模型用于真实低资源语言的研究。

关键词

引用

@article{arxiv.2210.04600,
  title  = {YFACC: A Yor\`ub\'a speech-image dataset for cross-lingual keyword localisation through visual grounding},
  author = {Kayode Olaleye and Dan Oneata and Herman Kamper},
  journal= {arXiv preprint arXiv:2210.04600},
  year   = {2022}
}

备注

Accepted to IEEE SLT 2022