TCIC:面向图像描述的主题概念跨语言与视觉学习
计算机视觉与模式识别
2021-06-22 v1 计算与语言
摘要
现有的图像描述研究通常用包含低层事实(对象与关系)的场景图表示图像,未能捕捉高层语义。本文提出一种主题概念扩展的图像描述(TCIC)框架,引入主题概念来表示高层跨模态语义。实践中,我们将主题概念建模为记忆向量,并提出带主题节点的 Transformer(TTN)来融入这些向量以进行图像描述。考虑到主题概念可从图像和描述中共同学习,我们基于 TTN 提出两种用于表示学习的设置。在视觉侧,TTN 被配置为以基于场景图的特征和主题概念作为输入进行视觉表示学习。在语言侧,TTN 被配置为以描述和主题概念作为输入进行文本表示重构。两种设置均旨在用相同的基于 Transformer 的解码器生成目标描述。在训练过程中,我们进一步对齐从图像和相应描述中学到的主题概念表示,以强化跨模态学习。在 MS COCO 上的实验结果表明,与一些最先进(SOTA)模型相比,我们的方法有效。
引用
@article{arxiv.2106.10936,
title = {TCIC: Theme Concepts Learning Cross Language and Vision for Image Captioning},
author = {Zhihao Fan and Zhongyu Wei and Siyuan Wang and Ruize Wang and Zejun Li and Haijun Shan and Xuanjing Huang},
journal= {arXiv preprint arXiv:2106.10936},
year = {2021}
}
备注
IJCAI2021