中文

巴西葡萄牙语图像描述生成:基于Transformer的跨本土翻译数据集研究

计算机视觉与模式识别 2026-02-03 v1 计算与语言 机器学习

摘要

图像描述(IC)指的是自动生成图像的自然语言描述,适用于从社交媒体内容生成到帮助视力受损者等应用。虽然大多数研究都集中在基于英文的模型上,但低资源语言如巴西葡萄牙语由于缺乏专门数据集和模型面临重大挑战。许多研究通过自动翻译现有数据集来缓解资源匮乏。这一工作通过对基于Transformer的视觉和语言模型进行跨本土翻译评估,弥补了这一差距。我们使用由原住巴西葡萄牙语母语者手动创建的描述版本的Flickr30K,并将其与来自英文到葡萄牙语的自动翻译版本进行比较。实验包括交叉情境方法,即在一个数据集上训练的模型在另一个数据集上测试,以评估翻译影响。此外,我们采用注意力图进行模型推断解释,并使用CLIP-Score指标评估图像-描述对齐。我们的发现表明,Swin-DistilBERTimbau 在数据集之间始终优于其他模型,显示出强大的跨数据集泛化能力。ViTucano,这一巴西葡萄牙语预训练视觉语言模型,在传统基于文本的评估指标中超越了更大的多语言模型(GPT-4o、LLaMa 3.2 Vision),而GPT-4模型在CLIP-Score上取得最高分,凸显了改进的图像-文本对齐。注意力分析揭示了系统性偏见,包括性别误分类、对象枚举错误和空间不一致。期间生成和分析的该研究中的数据集和模型可在:https://github.com/laicsiifes/transformer-caption-ptbr 获取。

关键词

引用

@article{arxiv.2602.00393,
  title  = {Brazilian Portuguese Image Captioning with Transformers: A Study on Cross-Native-Translated Dataset},
  author = {Gabriel Bromonschenkel and Alessandro L. Koerich and Thiago M. Paixão and Hilário Tomaz Alves de Oliveira},
  journal= {arXiv preprint arXiv:2602.00393},
  year   = {2026}
}

备注

Accepted to JBCS. 18 pages, 11 figures