中文

从图像到语言理解:图像描述方法

计算机视觉与模式识别 2020-02-25 v1

摘要

从视觉表示中提取上下文在计算机科学的发展中至关重要。将此格式用自然语言表示具有大量应用,例如帮助视障人士等。此类方法是计算机视觉与自然语言技术的结合,是一个难以解决的硬问题。本项目旨在比较解决图像描述问题的不同方法。具体而言,重点比较两类不同模型:编码器-解码器方法与多模态方法。在编码器-解码器方法中,将注入与合并架构同主要基于目标检测的多模态图像描述方法进行比较。这些方法的比较基于SOTA句子比较指标,如BLEU、GLEU、Meteor与Rouge,所用数据为含10万图像的Google Conceptual Captions数据集子集。基于此比较,我们观察到最佳模型为Inception注入式编码器模型。该最佳方法已部署为基于Web的系统。上传图像后,此类系统将输出与该图像关联的最佳描述。

关键词

引用

@article{arxiv.2002.09536,
  title  = {Image to Language Understanding: Captioning approach},
  author = {Madhavan Seshadri and Malavika Srikanth and Mikhail Belov},
  journal= {arXiv preprint arXiv:2002.09536},
  year   = {2020}
}

备注

8 pages