借助自身过往的一点帮助:用于图像描述的原型记忆网络
计算机视觉与模式识别
2023-08-25 v1 人工智能
计算与语言
多媒体
摘要
图像描述(image captioning)如同许多涉及视觉与语言的任务,目前依赖基于 Transformer 的架构来提取图像语义并转化为语言连贯的描述。尽管取得成功,注意力算子仅考虑当前输入样本投影的加权和,因而忽略了可来自其他样本联合观测的相关语义信息。本文设计了一种可通过原型记忆模型对处理其他训练样本时获得的激活执行注意力的网络。我们的记忆通过定义兼具判别性与紧凑性的原型向量来建模过往键和值的分布。在实验上,我们在 COCO 数据集上对比精心设计的基线和最先进方法评估了所提模型性能,并探究了各提出组件的作用。我们证明,无论仅在交叉熵下训练还是用自临界序列训练(self-critical sequence training)微调,我们的方案都能将编码器-解码器 Transformer 的性能提升 3.7 个 CIDEr 点。源代码与训练模型见:https://github.com/aimagelab/PMA-Net。
关键词
引用
@article{arxiv.2308.12383,
title = {With a Little Help from your own Past: Prototypical Memory Networks for Image Captioning},
author = {Manuele Barraco and Sara Sarto and Marcella Cornia and Lorenzo Baraldi and Rita Cucchiara},
journal= {arXiv preprint arXiv:2308.12383},
year = {2023}
}
备注
ICCV 2023