ReFormer:用于图像字幕的关系 Transformer
计算机视觉与模式识别
2022-07-18 v2
摘要
研究表明,利用场景图表示图像中物体的关系能够实现更好的图像字幕性能。当前的字幕编码器通常使用图卷积网络(GCN)表示关系信息,并通过拼接或卷积将其与物体区域特征合并,得到用于句子解码的最终输入。然而,现有方法中基于 GCN 的编码器在字幕任务上效果较差,原因有二。首先,以图像字幕为目标(即最大似然估计)而非以关系为中心的损失无法充分挖掘编码器的潜力。其次,使用预训练模型而非编码器自身来提取关系不够灵活,且无法有助于模型的可解释性。为提升图像字幕质量,我们提出一种新颖架构 ReFormer——一种关系 Transformer(RElational transFORMER),用于生成嵌入关系信息的特征,并显式表达图像中物体间的成对关系。ReFormer 使用一个改进的 Transformer 模型,将场景图生成目标与图像字幕目标相结合。该设计使 ReFormer 不仅能利用提取的强关系图像特征生成更好的图像字幕,还能生成显式描述成对关系的场景图。在公开数据集上的实验表明,我们的模型在图像字幕和场景图生成上显著优于最先进的方法。
引用
@article{arxiv.2107.14178,
title = {ReFormer: The Relational Transformer for Image Captioning},
author = {Xuewen Yang and Yingru Liu and Xin Wang},
journal= {arXiv preprint arXiv:2107.14178},
year = {2022}
}