中文

Bangla-Bayanno:一个由LLM辅助翻译精炼的52K对班加利语视觉问答数据集

计算与语言 2025-08-28 v1 计算机视觉与模式识别

摘要

本文介绍Bangla-Bayanno,这是一个面向班加利语的开放式视觉问答(VQA)数据集,班加利语是多模态AI研究中广泛使用的低资源语言。现有大多数数据集要么侧重于特定领域、查询类型或答案类型进行人工标注,要么受限于特定答案格式。为缓解人工引入的错误并确保清晰明了,我们实现了一个多语言LLM辅助翻译精炼管道。该数据集克服了多语言来源翻译质量低的局面。数据集包含52,650组问答对,涵盖4750多张图片。问题按三种不同的答案类型分类:名词性(简短描述性)、定量(数值)和极性(是/否)。Bangla-Bayanno提供了班加利语中最全面的开源高质量VQA基准,旨在推动低资源多模态学习研究,促进更具包容性的人工智能系统的开发。

关键词

引用

@article{arxiv.2508.19887,
  title  = {Bangla-Bayanno: A 52K-Pair Bengali Visual Question Answering Dataset with LLM-Assisted Translation Refinement},
  author = {Mohammed Rakibul Hasan and Rafi Majid and Ahanaf Tahmid},
  journal= {arXiv preprint arXiv:2508.19887},
  year   = {2025}
}