ChitroJera:面向孔加拉语的地区相关视觉问答数据集
计算机视觉与模式识别
2025-06-03 v2 计算与语言
摘要
视觉问答(VQA)指的是就视觉语境自然语言提问并作出回答的任务。尽管孔加拉语是广泛使用的语言,在 VQA 领域却因缺乏合适的基准数据集而被视为低资源语言。此外,现有孔加拉语 VQA 数据集提供的地区相关性有限,主要是从其它语言的数据集改编而来。为此,我们引入了一个大型孔加拉语 VQA 数据集,名为 ChitroJera,包含超过 15000 个样本,来源于多样化且具有当地相关性的数据源。我们评估了文本编码器、图像编码器、多模态模型以及我们新提出的双编码器模型的性能。实验结果表明,预训练的双编码器在同等规模的模型中性能优于其他模型。我们还采用基于提示的技术对当前大型视觉语言模型(LVLMs)进行了评估,取得了整体最佳性能。鉴于现有数据集的发展水平尚不成熟,我们期待 ChitroJera 将 Vision-Language 任务在孔加拉语中的应用范围进一步拓展。
引用
@article{arxiv.2410.14991,
title = {ChitroJera: A Regionally Relevant Visual Question Answering Dataset for Bangla},
author = {Deeparghya Dutta Barua and Md Sakib Ul Rahman Sourove and Md Fahim and Fabiha Haider and Fariha Tanjim Shifat and Md Tasmim Rahman Adib and Anam Borhan Uddin and Md Farhan Ishmam and Md Farhad Alam},
journal= {arXiv preprint arXiv:2410.14991},
year = {2025}
}
备注
Accepted in ECML PKDD 2025