通过条件 GAN 实现多样且自然的图像描述
计算机视觉与模式识别
2017-08-14 v3
摘要
尽管近年来取得了实质性进展,图像字幕技术仍远非完美。现有方法(例如基于 RNN 的方法)生成的句子往往过于刻板且缺乏多样性。这个问题与实践中广泛使用的一个学习原则有关,即最大化训练样本的似然。该原则鼓励与“真实”字幕高度相似,同时抑制其他合理的描述。传统的评估指标,例如 BLEU 和 METEOR,也偏爱这种限制性方法。在本文中,我们探索了一种替代方法,旨在提高自然性和多样性——人类表达的两个基本属性。具体来说,我们提出了一个基于条件生成对抗网络(CGAN)的新框架,该框架联合学习一个生成器以产生以图像为条件的描述,以及一个评估器以评估描述与视觉内容的匹配程度。值得注意的是,训练序列生成器并非易事。我们通过策略梯度(一种源自强化学习的策略)克服了这一困难,该策略允许生成器在生成过程中接收早期反馈。我们在两个大型数据集上测试了我们的方法,在用户研究中,其表现与真人相比具有竞争力,并在各种任务上优于其他方法。
引用
@article{arxiv.1703.06029,
title = {Towards Diverse and Natural Image Descriptions via a Conditional GAN},
author = {Bo Dai and Sanja Fidler and Raquel Urtasun and Dahua Lin},
journal= {arXiv preprint arXiv:1703.06029},
year = {2017}
}
备注
accepted in ICCV2017 as an Oral paper