将视觉空间、语言与常识结构整合到故事可视化中
计算与语言
2021-10-22 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
尽管文本到图像生成已有大量研究,但探索输入文本语言结构使用的工作甚少。此类信息对故事可视化更为重要,因为其输入具有需被转化为图像序列(或视觉故事)的显式叙事结构。该领域先前工作表明,在视觉质量、一致性与相关性方面,生成的图像序列仍有很大改进空间。本文中,我们首先探索使用基于 Transformer 的循环架构编码结构化输入,以利用 constituency parse trees(成分句法树)。其次,我们用常识信息增强结构化输入,并研究该外部知识对视觉故事生成的影响。第三,我们还通过边界框与密集描述(dense captioning)引入视觉结构,在双重学习设置中提供关于生成图像中角色/物体的反馈。我们展示在 Visual Genome 上训练的现成密集描述模型可改进来自不同目标域的图像空间结构而无需微调。我们使用故事内对比损失(词与图像子区域间)端到端训练模型,并在多个数据集上展示若干指标(及人工评估)的显著提升。最后,我们对语言与视觉空间信息进行分析。代码与数据:https://github.com/adymaharana/VLCStoryGan。
引用
@article{arxiv.2110.10834,
title = {Integrating Visuospatial, Linguistic and Commonsense Structure into Story Visualization},
author = {Adyasha Maharana and Mohit Bansal},
journal= {arXiv preprint arXiv:2110.10834},
year = {2021}
}
备注
EMNLP 2021 (16 pages)