通过对抗式语义对齐改进图像描述生成
机器学习
2019-06-10 v3 计算与语言
计算机视觉与模式识别
机器学习
摘要
本文将对图像描述生成研究为条件GAN训练,提出了一种上下文感知的LSTM描述生成器与协同注意力判别器,以强制图像与描述之间的语义对齐。我们实证聚焦于两种训练方法的可行性:自批判序列训练(SCST)与Gumbel直通(ST),并证明SCST展现出比Gumbel ST更稳定的梯度行为与更优结果,即便不直接访问判别器梯度。我们还解决了描述生成模型的自动评价问题,引入了一种新的语义分数,并展示了其与人类判断的相关性。作为一种评价范式,我们认为描述生成器的一个重要准则是泛化到通常不共现的物体组合的能力。为此,我们引入了一个小型的带描述的非上下文(OOC)测试集。OOC集合与我们提出的语义分数,是面向描述生成领域的新型诊断工具。在OOC与MS-COCO基准上评估时,我们表明基于SCST的训练在语义分数与人类评价上均有强劲表现,有望成为高效的离散GAN训练的新方法。
引用
@article{arxiv.1805.00063,
title = {Adversarial Semantic Alignment for Improved Image Captions},
author = {Pierre L. Dognin and Igor Melnyk and Youssef Mroueh and Jarret Ross and Tom Sercu},
journal= {arXiv preprint arXiv:1805.00063},
year = {2019}
}
备注
Authors Equal Contribution, CVPR 2019