中文

COCO-Urdu:大规模乌尔德语图像描述数据集与多模态质量评估

计算机视觉与模式识别 2025-09-12 v1 计算与语言

摘要

乌尔德语语种拥有超过2.5亿使用者,然而在多模态和视觉语言研究中仍严重缺乏服务。缺乏大规模高质量数据集限制了乌尔德语系统的发展,并强化了以高资源语言为主要训练对象的多语言视觉语言模型所固有的偏见。为填补这一差距,我们提出COCO-Urdu,这是一个大规模图像-描述数据集,源自MS COCO,包含59,000张图像和319,000条乌尔德语描述,通过分层抽样保留原始分布。描述使用SeamlessM4T v2进行翻译,并通过集成COMET-Kiwi进行翻译质量、CLIP-based相似度进行视觉对齐以及BERTScore配合回译进行语义一致性的混合多模态质量评估框架进行验证;对低分数描述使用开源大型语言模型进行迭代精炼。我们进一步在BLEU、SacreBLEU和chrF上对COCO-Urdu进行基准测试,结果 consistently 优异。鉴于COCO-Urdu目前是最大规模的公开乌尔德语描述数据集,我们希望通过发布数据集和质量评估管道,减少多模态研究中的语言偏见,为包容性视觉语言系统奠定基础。

关键词

引用

@article{arxiv.2509.09014,
  title  = {COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation},
  author = {Umair Hassan},
  journal= {arXiv preprint arXiv:2509.09014},
  year   = {2025}
}

备注

17 pages, 3 figures, 3 tables. Dataset available at https://huggingface.co/datasets/umairhassan02/urdu-translated-coco-captions-subset. Scripts and notebooks to reproduce results available at https://github.com/umair-hassan2/COCO-Urdu