超越叙述描述:通过多对抗训练从图像生成诗歌
计算机视觉与模式识别
2018-10-11 v4 人工智能
多媒体
摘要
从图像自动生成自然语言已引起广泛关注。本文更进一步,探究对图像生成诗歌语言(多行)以实现自动诗歌创作。该任务涉及多重挑战,包括从图像中发现诗歌线索(如从绿色中读出希望),以及生成既与图像相关又具语言层面诗意的诗歌。为解决上述挑战,我们通过策略梯度下的多对抗训练将诗歌生成任务表述为两个相关子任务,从而确保跨模态相关性与诗歌语言风格。为从图像提取诗歌线索,我们提出学习一种深度耦合的视觉-诗歌嵌入,其中图像中物体、情感与场景的诗歌表示可被联合学习。进一步引入两个判别网络以引导诗歌生成,包括多模态判别器与诗歌风格判别器。为便利研究,我们由人工标注发布两个具不同属性的诗歌数据集:1)首个由人标注的图像到诗歌配对数据集(共8,292对),以及2)迄今最大的公开英文诗歌语料库数据集(共92,265首不同诗歌)。我们使用8K图像进行了大量实验,其中随机选取1.5K图像用于评估。客观与主观评估均显示出相对于最先进(state-of-the-art)图像诗歌生成方法的优越性能。由超过500名人类受试者(其中30名为诗歌专家)进行的图灵测试证明了我们方法的有效性。
引用
@article{arxiv.1804.08473,
title = {Beyond Narrative Description: Generating Poetry from Images by Multi-Adversarial Training},
author = {Bei Liu and Jianlong Fu and Makoto P. Kato and Masatoshi Yoshikawa},
journal= {arXiv preprint arXiv:1804.08473},
year = {2018}
}