用于端到端图像描述生成的渐进树结构原型网络
计算机视觉与模式识别
2022-11-18 v1
摘要
图像描述生成的研究正借助强大的视觉预训练模型和基于 transformer 的生成架构,向完全端到端范式转变,以实现更灵活的模型训练和更快的推理速度。最先进的方法只是提取孤立的概念或属性来辅助描述生成。然而,此类方法未考虑文本域中的层次语义结构,导致视觉表示与概念词之间出现不可预测的映射。为此,我们提出了一种新颖的渐进树结构原型网络(称为 PTSN),首次尝试通过建模层次化文本语义来以适当语义缩小预测词的范围。具体而言,我们设计了一种称为树结构原型的新颖嵌入方法,生成一组捕获文本空间中层次语义结构的层次化代表性嵌入。为将此类树结构原型用于视觉认知,我们还提出了一种渐进聚合模块来利用图像与原型内的语义关系。通过将我们的 PTSN 应用于端到端描述框架,在 MSCOCO 数据集上进行的广泛实验表明,我们的方法取得了新的最先进性能,在 'Karpathy' 划分上 CIDEr 分数达 144.2%(单模型)和 146.5%(4 模型集成),在官方在线测试服务器上 CIDEr 分数达 141.4%(c5)和 143.9%(c40)。训练好的模型和源代码已发布于:https://github.com/NovaMind-Z/PTSN。
引用
@article{arxiv.2211.09460,
title = {Progressive Tree-Structured Prototype Network for End-to-End Image Captioning},
author = {Pengpeng Zeng and Jinkuan Zhu and Jingkuan Song and Lianli Gao},
journal= {arXiv preprint arXiv:2211.09460},
year = {2022}
}