利用条件生成对抗网络改进图像描述生成
计算机视觉与模式识别
2020-09-10 v4 机器学习
摘要
本文提出一种新颖的基于条件生成对抗网络的图像描述生成框架,作为传统基于强化学习(RL)的编码器-解码器架构的扩展。为应对不同客观语言度量指标间评估不一致的问题,我们设计若干“判别器”网络,以自动且渐进地判断生成的描述是由人类给出还是机器生成的。由于各自具有优势,我们引入了两类判别器架构(基于 CNN 与基于 RNN 的结构)。所提算法具有通用性,可增强任何现有的基于 RL 的图像描述生成框架,并且我们表明常规 RL 训练方法仅为本文方法的一个特例。经验上,我们在不同最先进图像描述生成模型上展示了所有语言评估指标的一致提升。此外,训练良好的判别器也可视为客观的图像描述评估器。
引用
@article{arxiv.1805.07112,
title = {Improving Image Captioning with Conditional Generative Adversarial Nets},
author = {Chen Chen and Shuai Mu and Wanpeng Xiao and Zexiong Ye and Liesi Wu and Qi Ju},
journal= {arXiv preprint arXiv:1805.07112},
year = {2020}
}
备注
12 pages; 33 figures; 36 refenences; Accepted by AAAI2019