中文

AFRICAPTION:面向非洲语言图像描述的新范式构建

计算与语言 2025-10-21 v1 人工智能

摘要

多模态 AI 研究几乎聚焦于高资源语言,阻碍了该领域进展的民主化。为此,我们提出 AfriCaption,一个针对 20 种非洲语言的多语言图像描述综合框架,其贡献主要包括:(i)基于 Flickr8k 构建的精选数据集,采用上下文感知的选择与翻译过程生成语义对齐的描述;(ii)动态、保持上下文的管道,通过模型集成和自适应替换确保持续的数据质量;(iii)AfriCaption 模型,一个 0.5B 参数的视觉到文本架构,集成 SigLIP 和 NLLB200 实现跨非代表性语言的描述生成。该统一框架确保数据质量持续可靠,首次建立面向非代表性非洲语言的可扩展图像-描述资源,为 truly 包容的多模态 AI 奠定基础。

关键词

引用

@article{arxiv.2510.17405,
  title  = {AFRICAPTION: Establishing a New Paradigm for Image Captioning in African Languages},
  author = {Mardiyyah Oduwole and Prince Mireku and Fatimo Adebanjo and Oluwatosin Olajide and Mahi Aminu Aliyu and Jekaterina Novikova},
  journal= {arXiv preprint arXiv:2510.17405},
  year   = {2025}
}