将视觉场景图转换为图像描述
计算机视觉与模式识别
2023-12-12 v4
摘要
我们提出将场景图转换(TSG)为更具描述性的描述。在 TSG 中,我们应用多头注意力(MHA)设计图神经网络(GNN)以嵌入场景图。嵌入后,不同的图嵌入包含用于生成不同词性单词的多样特定知识,例如对象/属性嵌入善于生成名词/形容词。受此启发,我们设计了一个基于专家混合(MOE)的解码器,其中每个专家构建于 MHA 之上,用于区分图嵌入以生成不同种类的单词。由于编码器与解码器均基于 MHA 构建,我们因而构造了一个同构的编码器-解码器,不同于以往通常采用基于全连接的 GNN 和基于 LSTM 的解码器的异构架构。同构架构使我们能够统一整个模型的训练配置,而无需像异构流程那样为不同子网络指定不同训练策略,从而降低了训练难度。在 MS-COCO 描述基准上的大量实验验证了我们的 TSG 的有效性。代码见:https://github.com/GaryJiajia/TSG。
引用
@article{arxiv.2305.02177,
title = {Transforming Visual Scene Graphs to Image Captions},
author = {Xu Yang and Jiawei Peng and Zihua Wang and Haiyang Xu and Qinghao Ye and Chenliang Li and Songfang Huang and Fei Huang and Zhangzikang Li and Yu Zhang},
journal= {arXiv preprint arXiv:2305.02177},
year = {2023}
}
备注
12 pages, 4 figures, has been accepted by ACL 2023 main conference