中文

通过语义一致性改进视觉故事的生成与评估

计算与语言 2021-05-24 v1 人工智能 计算机视觉与模式识别

摘要

故事可视化是一项未被充分探索的任务,处于计算机视觉与自然语言处理中许多重要研究领域的交叉点。在该任务中,给定一系列构成故事的自然语言描述,智能体必须生成与这些描述相对应的图像序列。先前的工作引入了循环生成模型,在此任务上优于文本到图像合成模型。然而,在视觉质量、连贯性与相关性方面,生成图像仍有改进空间。我们对先前的建模方法提出若干改进,包括(1)添加双学习框架,利用视频描述来强化故事与生成图像之间的语义对齐;(2)用于序列一致故事可视化的复制-变换机制;(3)基于 MART 的 transformers 以建模帧间复杂交互。我们给出消融实验,以展示这些技术对模型在单幅图像及整个叙事上生成能力的影响。此外,由于该任务的复杂性与生成性质,标准评估指标无法准确反映性能。因此,我们还对该模型的评估指标进行了探索,聚焦于生成帧的各个方面,如生成角色的存在/质量、与描述的相关性以及生成图像的多样性。我们还给出了所提出的自动化指标与人类评估的相关性实验。代码与数据见:https://github.com/adymaharana/StoryViz

关键词

引用

@article{arxiv.2105.10026,
  title  = {Improving Generation and Evaluation of Visual Stories via Semantic Consistency},
  author = {Adyasha Maharana and Darryl Hannan and Mohit Bansal},
  journal= {arXiv preprint arXiv:2105.10026},
  year   = {2021}
}

备注

NAACL 2021 (16 pages)