基于离散-连续动作空间策略梯度的图像-文本匹配注意力方法
计算机视觉与模式识别
2021-04-22 v1
摘要
图像-文本匹配是一项具有大量应用的重要多模态任务。它试图将具有相似语义信息的图像和文本进行匹配。现有方法未显式地将不同模态变换到公共空间。同时,广泛用于图像-文本匹配模型的注意力机制缺乏监督。我们提出了一种新颖的注意力方案,将图像和文本嵌入投影到公共空间,并直接针对评估指标优化注意力权重。所提出的注意力方案可视为一种有监督注意力,且不需要额外标注。它通过一种新颖的离散-连续动作空间策略梯度算法进行训练,该算法比先前的连续动作空间策略梯度在建模复杂动作空间上更有效。我们在两个广泛使用的基准数据集Flickr30k和MS-COCO上评估了所提方法,以较大优势优于先前的方法。
引用
@article{arxiv.2104.10406,
title = {Discrete-continuous Action Space Policy Gradient-based Attention for Image-Text Matching},
author = {Shiyang Yan and Li Yu and Yuan Xie},
journal= {arXiv preprint arXiv:2104.10406},
year = {2021}
}