巴西西语图像标语生成:基于 GRIT 模型的研究
计算机视觉与模式识别
2024-02-08 v1 人工智能
计算与语言
摘要
本文报告了巴西西语图像标语生成模型的早期开发。我们采用 GRIT(Grid - 和 Region-based Image captioning Transformer)模型完成了本项工作。GRIT 是一种仅使用 Transformer 结构的神经网络架构,有效利用两种视觉特征来生成更优质的图像标语。GRIT 方法的提出旨在提供一种更高效的图像标语生成方式。本文通过在巴西西语数据集上对 GRIT 模型进行训练,实现了针对巴西西语语言的图像标语生成方法。
关键词
引用
@article{arxiv.2402.05106,
title = {Image captioning for Brazilian Portuguese using GRIT model},
author = {Rafael Silva de Alencar and William Alberto Cruz Castañeda and Marcellus Amadeus},
journal= {arXiv preprint arXiv:2402.05106},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2207.09666 by other authors