中文

Prophet Attention:利用未来注意力预测注意力以用于图像描述

计算机视觉与模式识别 2023-04-12 v2 计算与语言

摘要

近来,基于注意力的模型已被广泛用于许多序列到序列学习系统。尤其在图像描述中,基于注意力的模型被期望将正确图像区域与恰当生成词对齐。然而,在解码过程的每个时间步,基于注意力的模型通常使用当前输入的隐藏状态来关注图像区域。在此设置下,这些注意力模型存在“焦点偏离”问题:它们基于已生成词而非待生成词计算注意力权重,损害了对齐与描述性能。本文提出 Prophet Attention,其形式类似于自监督。在训练阶段,该模块利用未来信息计算朝向图像区域的“理想”注意力权重。这些计算的“理想”权重进一步用于正则化“偏离”的注意力。以此方式,图像区域与正确词对齐。所提 Prophet Attention 可轻松嵌入现有图像描述模型以提升其对齐与描述性能。在 Flickr30k Entities 与 MSCOCO 数据集上的实验表明,所提 Prophet Attention 在自动指标与人工评估上均一致优于基线。值得注意的是,我们在两个基准数据集上刷新了最优结果,并在在线 MSCOCO 基准的默认排序分数(即 CIDEr-c40)排行榜上取得第 1 名。

关键词

引用

@article{arxiv.2210.10914,
  title  = {Prophet Attention: Predicting Attention with Future Attention for Image Captioning},
  author = {Fenglin Liu and Xuancheng Ren and Xian Wu and Wei Fan and Yuexian Zou and Xu Sun},
  journal= {arXiv preprint arXiv:2210.10914},
  year   = {2023}
}

备注

Accepted by NeurIPS 2020