用于图像描述的网格记忆 Transformer
计算机视觉与模式识别
2020-03-24 v2 计算与语言
摘要
基于 Transformer 的架构在机器翻译与语言理解等序列建模任务中代表了当前最优水平。然而,它们在图像描述等多模态情境中的适用性仍很大程度上未被充分探索。为填补这一空白,我们提出 M——一种用于图像描述的带记忆的网格 Transformer(Meshed Transformer with Memory)。该架构改进了图像编码与语言生成两个步骤:它学习图像区域间关系的多级表示并整合习得的先验知识,并在解码阶段使用网格状连接以利用低层与高层特征。在实验上,我们研究了 M Transformer 与不同全注意力模型相较于循环模型的表现。在 COCO 上测试时,我们的方案在“Karpathy”测试划分与在线测试服务器上的单模型与集成配置中均达到了新的最优水平。我们还评估了其在描述训练集中未出现物体时的表现。用于复现实验的已训练模型与代码公开于:https://github.com/aimagelab/meshed-memory-transformer。
引用
@article{arxiv.1912.08226,
title = {Meshed-Memory Transformer for Image Captioning},
author = {Marcella Cornia and Matteo Stefanini and Lorenzo Baraldi and Rita Cucchiara},
journal= {arXiv preprint arXiv:1912.08226},
year = {2020}
}
备注
CVPR 2020