中文

图像字幕生成的超参数分析

计算机视觉与模式识别 2020-06-22 v1 机器学习

摘要

在本文中,我们使用两种不同架构(CNN+LSTM和CNN+Transformer)对最先进的图像字幕生成方法进行了全面的敏感性分析。实验使用Flickr8k数据集进行。实验最重要的结论是,对CNN编码器进行微调优于基线以及为两种架构所进行的所有其他实验。

关键词

引用

@article{arxiv.2006.10923,
  title  = {Hyperparameter Analysis for Image Captioning},
  author = {Amish Patel and Aravind Varier},
  journal= {arXiv preprint arXiv:2006.10923},
  year   = {2020}
}

备注

10 pages, 9 figures, and 7 tables