中文

对齐“看何处”与“说何物”:基于区域注意力与场景分解的图像描述生成

计算机视觉与模式识别 2015-06-23 v1 机器学习 机器学习

摘要

近期在图像描述自动生成方面的进展表明,可用准确且有意义的句子描述图像所传达的最显著信息。本文提出一种利用图像与句子之间并行结构的图像描述系统。在我们的模型中,给定已生成词后生成下一个词的过程,与视觉感知体验相对齐,其中视觉区域间的注意力转移施加了一条视觉排序线索。这种对齐刻画了“抽象意义”的流动,编码了视觉场景与文本描述在语义上共享的内容。我们的系统还通过引入场景特定上下文做出了另一项新颖建模贡献,这些上下文捕获图像中编码的更高层语义信息。这些上下文使语言模型适应特定场景类型以生成词语。我们在数个流行数据集上对我们的系统进行了基准测试并与已发表结果对比。我们表明,单独使用基于区域的注意力或场景特定上下文均能改进不含这些组件的系统。此外,结合这两种建模要素可达到最先进的性能。

关键词

引用

@article{arxiv.1506.06272,
  title  = {Aligning where to see and what to tell: image caption with region-based attention and scene factorization},
  author = {Junqi Jin and Kun Fu and Runpeng Cui and Fei Sha and Changshui Zhang},
  journal= {arXiv preprint arXiv:1506.06272},
  year   = {2015}
}