将语义概念注入端到端图像描述生成
计算机视觉与模式识别
2022-04-01 v2 计算与语言
摘要
近年来,在开发更好的图像描述模型方面取得了巨大进展,但其中大多数依赖于单独的目标检测器来提取区域特征。近期的视觉-语言研究正通过利用网格表示以实现更灵活的模型训练和更快的推理速度,转向无检测器的趋势。然而,此类发展主要集中于图像理解任务,对于描述生成任务的探索仍然不足。在本文中,我们关注性能更优的无检测器图像描述模型,并提出一种纯视觉 transformer 架构的图像描述模型,称为 ViTCAP,其中使用网格表示而无需提取区域特征。为提升性能,我们引入了一种新颖的概念词元网络(CTN)来预测语义概念,并将其融入端到端描述生成中。具体而言,CTN 构建于视觉 transformer 之上,并通过分类任务设计以预测概念词元,其所包含的丰富语义信息极大裨益于描述任务。与先前基于检测器的模型相比,ViTCAP 大幅简化了架构,同时在多个具有挑战性的图像描述数据集上取得了有竞争力的性能。特别地,ViTCAP 在 COCO-caption Karpathy-split 上达到 138.1 的 CIDEr 分数,在 nocaps 和 Google-CC 描述数据集上分别达到 93.8 和 108.6 的 CIDEr 分数。
引用
@article{arxiv.2112.05230,
title = {Injecting Semantic Concepts into End-to-End Image Captioning},
author = {Zhiyuan Fang and Jianfeng Wang and Xiaowei Hu and Lin Liang and Zhe Gan and Lijuan Wang and Yezhou Yang and Zicheng Liu},
journal= {arXiv preprint arXiv:2112.05230},
year = {2022}
}