中文

#PraCegoVer:一个用于葡萄牙语图像描述的大型数据集

计算机视觉与模式识别 2026-04-21 v2 计算与语言

摘要

使用自然语句自动描述图像是支持视障人士融入互联网的一项重要任务。这仍是一个巨大挑战,需要理解图像中出现的物体及其属性和所参与动作之间的关系。因此,需要视觉解释方法,但也需要语言模型来口头描述语义关系。该问题被称为图像描述(Image Captioning)。尽管文献中提出了许多数据集,但大多数仅包含英文描述,而带有其他语言描述的数据集十分匮乏。最近,互联网上兴起了一场名为PraCegoVer的运动,激励社交媒体用户发布图像、标记#PraCegoVer并添加对其内容的简短描述。因此,受该运动启发,我们提出了#PraCegoVer,一个基于Instagram帖子的葡萄牙语描述多模态数据集。它是第一个用于葡萄牙语图像描述且带有自由标注图像的大型数据集。此外,我们数据集中的描述给该问题带来了额外挑战:首先,与MS COCO Captions等流行数据集不同,#PraCegoVer对每幅图像仅有一个参考描述;同时,我们参考句长度的平均值和方差均显著大于MS COCO Captions中的相应值。这两个特征因其语言层面特性及为图像描述问题引入的挑战而使我们数据集颇具意义。我们在 https://github.com/gabrielsantosrv/PraCegoVer 公开共享该数据集。

关键词

引用

@article{arxiv.2103.11474,
  title  = {#PraCegoVer: A Large Dataset for Image Captioning in Portuguese},
  author = {Gabriel Oliveira dos Santos and Esther Luna Colombini and Sandra Avila},
  journal= {arXiv preprint arXiv:2103.11474},
  year   = {2026}
}

备注

23 pages, 21 figures, 2 tables