近期图像描述深度学习方法的全面综述
计算机视觉与模式识别
2021-07-29 v1
摘要
图像描述是一项结合计算机视觉与自然语言处理的任务,旨在为图像生成描述性图注。它是一个依赖准确图像理解与正确语言理解(句法与语义上)的双重过程。由于该主题可用知识量不断增长,跟上图像描述领域最新研究与发现变得愈发困难。然而,现有综述论文对这些发现的覆盖尚不充分。我们在本文中对图像描述中使用的当前技术、数据集、基准与评估指标进行了梳理。该领域当前研究主要聚焦于基于深度学习的方法,其中注意力机制与深度强化学习及对抗学习似乎处于该研究课题的前沿。本文综述了UpDown、OSCAR、VIVO、元学习以及使用条件生成对抗网络的模型等近期方法。尽管基于GAN的模型取得最高分数,UpDown构成了图像描述的重要基础,而OSCAR与VIVO因使用新颖对象描述而更具实用性。本综述论文可作为研究人员了解图像描述生成领域最新进展的路线图。
引用
@article{arxiv.2107.13114,
title = {A Thorough Review on Recent Deep Learning Methodologies for Image Captioning},
author = {Ahmed Elhagry and Karima Kadaoui},
journal= {arXiv preprint arXiv:2107.13114},
year = {2021}
}