结合Transformer与课程学习的双图卷积网络用于图像字幕
计算机视觉与模式识别
2021-08-06 v1
摘要
现有的图像字幕方法仅关注理解单幅图像中物体或实例之间的关系,而未探索上下文图像之间存在的上下文关联。在本文中,我们提出结合Transformer与课程学习的双图卷积网络(Dual-GCN)用于图像字幕。具体而言,我们不仅使用物体级GCN来捕获单幅图像内物体到物体的空间关系,还采用图像级GCN来捕获相似图像提供的特征信息。借助精心设计的Dual-GCN,我们可以使语言Transformer更好地理解单幅图像中不同物体之间的关系,并充分利用相似图像作为辅助信息为单幅图像生成合理的字幕描述。同时,引入交叉评审策略以确定难度级别,我们采用课程学习作为训练策略以提升所提模型的鲁棒性与泛化能力。我们在大规模MS COCO数据集上进行了大量实验,实验结果有力地证明了我们所提方法优于近期最先进的方法。其取得了82.2的BLEU-1分数与67.6的BLEU-2分数。我们的源代码可在{\em \color{magenta}{\url{https://github.com/Unbear430/DGCN-for-image-captioning}}}获取。
关键词
引用
@article{arxiv.2108.02366,
title = {Dual Graph Convolutional Networks with Transformer and Curriculum Learning for Image Captioning},
author = {Xinzhi Dong and Chengjiang Long and Wenju Xu and Chunxia Xiao},
journal= {arXiv preprint arXiv:2108.02366},
year = {2021}
}
备注
This paper was accepted to the 29th ACM International Conference on Multimedia (ACM MM), Chengdu, Sichuan, China, Oct 20-24, 2021