通过对比对抗学习生成多样且准确的视觉描述
计算机视觉与模式识别
2019-03-12 v3
摘要
我们研究如何生成不仅准确描述图像而且在不同图像间具有区分性的描述。这个问题既基础又有趣,因为尽管过去几年取得了显著的研究进展,大多数机器生成的描述仍以非常单调且无特征的格式表达。虽然此类描述通常准确,但它们往往缺乏人类语言中的重要特征——每个描述的独特性和不同图像的多样性。为了解决这个问题,我们提出了一种新颖的条件生成对抗网络,用于生成跨图像的多样描述。所提出的对比对抗学习框架不是仅基于单张图像估计描述的质量,而是通过比较图像-描述联合空间内的一组描述来更好地评估描述质量。通过与人类书写的描述和图像不匹配的描述进行对比,描述生成器有效利用了人类语言的固有特征,并生成更具区分性的描述。我们展示了我们提出的网络能够生成跨图像的准确和多样描述。
引用
@article{arxiv.1804.00861,
title = {Generating Diverse and Accurate Visual Captions by Comparative Adversarial Learning},
author = {Dianqi Li and Qiuyuan Huang and Xiaodong He and Lei Zhang and Ming-Ting Sun},
journal= {arXiv preprint arXiv:1804.00861},
year = {2019}
}