中文

用于图像描述生成的CNN架构对比评估

计算机视觉与模式识别 2021-02-24 v1 人工智能 机器学习 多媒体 神经与进化计算

摘要

在深度学习的近期进展助力下,图像描述生成在过去几年中取得了巨大进步。大多数方法利用迁移学习,借助预训练的卷积神经网络模型以图像特征的形式提取视觉信息,随后通过描述生成模块对视觉信息进行变换以生成输出句子。不同方法使用了不同的卷积神经网络架构,据我们所知,目前尚无系统研究比较不同卷积神经网络架构在提取视觉信息方面的相对效能。在本工作中,我们在两个流行的图像描述生成框架上评估了17种不同的卷积神经网络:第一个基于神经图像描述(NIC)生成模型,第二个基于软注意力框架。我们观察到,卷积神经网络的模型复杂度(以参数数量衡量)及其在物体识别任务上的准确率,并不一定与其在图像描述生成任务中特征提取的效能相关。

关键词

引用

@article{arxiv.2102.11506,
  title  = {Comparative evaluation of CNN architectures for Image Caption Generation},
  author = {Sulabh Katiyar and Samir Kumar Borgohain},
  journal= {arXiv preprint arXiv:2102.11506},
  year   = {2021}
}

备注

Article Published in International Journal of Advanced Computer Science and Applications(IJACSA), Volume 11 Issue 12, 2020