中文

BAN-Cap:一个多用途英语-孟加拉语图像描述数据集

计算与语言 2022-05-31 v1

摘要

随着计算机已能高效理解视觉信息并将其转化为书面表达,近年来对自动图像描述等任务的研究兴趣显著增长。尽管多数研究关注单语环境下的英语,像孟加拉语这类资源受限语言仍被忽视,主要由于缺乏标准数据集。针对此问题,我们遵循广泛使用的 Flickr8k 数据集提出新数据集 BAN-Cap,由合格标注者收集所提供图像的孟加拉语描述。我们的数据集代表了由不同背景受过训练人员标注的更广泛图像描述风格。我们给出数据集的定量与定性分析,以及近期模型在孟加拉语图像描述上的基线评估。我们探究了文本增强的效果,并证明基于自适应注意力并结合使用上下文词替换(CWR)的文本增强的模型优于所有最先进的孟加拉语图像描述模型。我们还展示了该数据集的多用途特性,尤其在孟加拉语-英语和英语-孟加拉语机器翻译方面。该数据集及所有模型将有助于进一步研究。

关键词

引用

@article{arxiv.2205.14462,
  title  = {BAN-Cap: A Multi-Purpose English-Bangla Image Descriptions Dataset},
  author = {Mohammad Faiyaz Khan and S. M. Sadiq-Ur-Rahman Shifath and Md Saiful Islam},
  journal= {arXiv preprint arXiv:2205.14462},
  year   = {2022}
}

备注

Accepted in the 13th Edition of Language Resources and Evaluation Conference (LREC 2022)