HaVQA:面向豪萨语视觉问答与多模态研究的数据集
计算与语言
2023-05-30 v1
摘要
本文提出 HaVQA,这是首个面向豪萨语视觉问答(VQA)任务的多模态数据集。该数据集通过人工翻译 6,022 个英文问答对创建,这些问答对关联自 Visual Genome 数据集中的 1,555 张独特图像。由此,该数据集提供了 12,044 条黄金标准英—豪萨平行句,其翻译方式保证了与相应视觉信息的语义匹配。我们在该数据集上进行了若干基线实验,包括视觉问答、视觉问题引出、纯文本与多模态机器翻译。
引用
@article{arxiv.2305.17690,
title = {HaVQA: A Dataset for Visual Question Answering and Multimodal Research in Hausa Language},
author = {Shantipriya Parida and Idris Abdulmumin and Shamsuddeen Hassan Muhammad and Aneesh Bose and Guneet Singh Kohli and Ibrahim Said Ahmad and Ketan Kotwal and Sayan Deb Sarkar and Ondřej Bojar and Habeebah Adamu Kakudi},
journal= {arXiv preprint arXiv:2305.17690},
year = {2023}
}
备注
Accepted at ACL 2023 as a long paper (Findings)