中文

融合自底向上与多级残差自顶向下注意力的游戏场景理解图像描述生成

计算机视觉与模式识别 2019-06-18 v1

摘要

图像描述生成近年来引起了相当多的关注。然而,针对游戏图像描述生成的工作很少,而该任务具有一些独特的特征与要求。在本工作中,我们提出了一种新颖的游戏图像描述模型,其将自底向上注意力与一种新的多级残差自顶向下注意力机制相融合。首先,在基于 Faster R-CNN 的自底向上注意力网络上添加一个较低级残差自顶向下注意力网络,以解决后者在提取区域特征时可能丢失重要空间信息的问题。其次,在描述生成网络中实现了一个较高级残差自顶向下注意力网络,以更好地融合所提取的区域特征用于后续描述预测。我们创建了两个游戏数据集来评估所提出的模型。大量实验表明,我们提出的模型优于现有的基线模型。

关键词

引用

@article{arxiv.1906.06632,
  title  = {Image Captioning with Integrated Bottom-Up and Multi-level Residual Top-Down Attention for Game Scene Understanding},
  author = {Jian Zheng and Sudha Krishnamurthy and Ruxin Chen and Min-Hung Chen and Zhenhao Ge and Xiaohua Li},
  journal= {arXiv preprint arXiv:1906.06632},
  year   = {2019}
}