图像字幕生成的超参数分析
计算机视觉与模式识别
2020-06-22 v1 机器学习
摘要
在本文中,我们使用两种不同架构(CNN+LSTM和CNN+Transformer)对最先进的图像字幕生成方法进行了全面的敏感性分析。实验使用Flickr8k数据集进行。实验最重要的结论是,对CNN编码器进行微调优于基线以及为两种架构所进行的所有其他实验。
引用
@article{arxiv.2006.10923,
title = {Hyperparameter Analysis for Image Captioning},
author = {Amish Patel and Aravind Varier},
journal= {arXiv preprint arXiv:2006.10923},
year = {2020}
}
备注
10 pages, 9 figures, and 7 tables