中文

探索并蒸馏跨模态信息用于图像描述生成

计算机视觉与模式识别 2020-03-17 v2 计算与语言 机器学习

摘要

近年来,基于注意力的编码器-解码器模型已被广泛用于图像描述生成。然而,现有方法仍极难实现深度图像理解。本文中,我们认为这种理解需要关注相关图像区域的视觉注意力,以及关注感兴趣属性的语义注意力。基于 Transformer,为进行有效注意力建模,我们从跨模态视角探讨图像描述生成,并提出全局与局部信息探索-蒸馏方法,对视觉与语言中的源信息进行探索与蒸馏。该方法基于描述上下文,通过提取显著区域组合与属性搭配,全局提供作为图像空间与关系表示的方面向量;并参照方面向量局部提取细粒度区域与属性以进行选词。我们基于 Transformer 的模型在 COCO 测试集的离线 COCO 评估中取得了 129.3 的 CIDEr 分数,并在精度、速度与参数量方面具有显著效率。

关键词

引用

@article{arxiv.2002.12585,
  title  = {Exploring and Distilling Cross-Modal Information for Image Captioning},
  author = {Fenglin Liu and Xuancheng Ren and Yuanxin Liu and Kai Lei and Xu Sun},
  journal= {arXiv preprint arXiv:2002.12585},
  year   = {2020}
}

备注

Accepted by IJCAI 2019