中文

BIG-C:一个用于 Bemba 语的多模态多用途数据集

计算与语言 2023-05-30 v1

摘要

我们提出 BIG-C(Bemba Image Grounded Conversations),一个面向 Bemba 语的大型多模态数据集。尽管 Bemba 语是赞比亚使用人口最多的语言,但其资源匮乏,致使语言技术开发或语言处理研究几乎无从开展。该数据集由 Bemba 语使用者基于图像的多轮对话组成,经转写并译为英语。其包含超过 92,000 条话语/句子,对应超过 180 小时音频数据及相应转写与英译文本。我们还给出了语音识别(ASR)、机器翻译(MT)和语音翻译(ST)任务的基线,并勾勒出本数据集其他潜在的多模态用途。我们希望通过向研究界开放该数据集,促进研究并鼓励语言、语音与视觉界之间的协作,尤其针对传统上高资源以外的语言。所有数据与代码公开可用:https://github.com/csikasote/bigc。

关键词

引用

@article{arxiv.2305.17202,
  title  = {BIG-C: a Multimodal Multi-Purpose Dataset for Bemba},
  author = {Claytone Sikasote and Eunice Mukonde and Md Mahfuz Ibn Alam and Antonios Anastasopoulos},
  journal= {arXiv preprint arXiv:2305.17202},
  year   = {2023}
}

备注

accepted to ACL 2023