用于视觉段落生成的循环主题转换生成对抗网络(RTT-GAN)
计算机视觉与模式识别
2017-03-27 v2 人工智能
机器学习
摘要
自然图像通常传达丰富的语义内容,并可从不同角度观看。现有的图像描述方法很大程度上受限于小规模有偏的视觉段落标注,无法覆盖丰富的底层语义。本文研究一种半监督段落生成框架,能够通过推理局部语义区域并利用语言知识来合成多样且语义连贯的段落描述。所提出的循环主题转换生成对抗网络(RTT-GAN)在结构化段落生成器与多级段落判别器之间构建对抗框架。段落生成器通过在每一步融入基于区域的视觉与语言注意力机制来循环生成句子。生成的段落句子质量由多级对抗判别器从两个方面评估,即句子层面的合理性与段落层面的主题转换连贯性。RTT-GAN 的联合对抗训练驱动模型生成具有句子主题间平滑逻辑过渡的真实段落。在图像与视频段落数据集上的大量定量实验证明了我们的 RTT-GAN 在监督与半监督设置下的有效性。针对单幅图像讲述多样故事定性结果也验证了 RTT-GAN 的可解释性。
引用
@article{arxiv.1703.07022,
title = {Recurrent Topic-Transition GAN for Visual Paragraph Generation},
author = {Xiaodan Liang and Zhiting Hu and Hao Zhang and Chuang Gan and Eric P. Xing},
journal= {arXiv preprint arXiv:1703.07022},
year = {2017}
}
备注
10 pages, 6 figures