中文

StoryDALL-E:适配预训练文本到图像 Transformer 用于故事续写

计算机视觉与模式识别 2022-09-14 v1 人工智能 计算与语言

摘要

文本到图像合成的最新进展催生了具有卓越能力的大型预训练 Transformer,可从给定文本生成可视化结果。然而,这些模型并不适合故事可视化等专门任务,该任务要求智能体根据给定的对应字幕序列生成图像序列,从而形成叙事。此外,我们发现故事可视化任务无法适应新叙事中未见过的情节与角色泛化。因此,我们首先提出故事续写任务,其中生成的视觉故事以源图像为条件,从而更好地泛化到具有新角色的叙事。然后,我们用用于(a)序列图像生成与(b)从初始帧复制相关元素的任务特定模块来增强或“改造”预训练文本到图像合成模型。接着,我们探索了全模型微调以及用于参数高效适配的基于提示的调优。我们在两个现有数据集 PororoSV 和 FlintstonesSV 上评估我们的方法 StoryDALL-E,并引入从视频字幕数据集收集的新数据集 DiDeMoSV。我们还基于生成对抗网络(GAN)开发了用于故事续写的模型 StoryGANc,并与 StoryDALL-E 模型比较以展示我们方法的优势。我们表明,我们的改造方法在故事续写上优于基于 GAN 的模型,并促进了从源图像复制视觉元素,从而改善生成视觉故事的连续性。最后,我们的分析表明预训练 Transformer 难以理解包含多个角色的叙事。总体而言,我们的工作表明预训练文本到图像合成模型可被适配用于故事续写等复杂且低资源任务。

关键词

引用

@article{arxiv.2209.06192,
  title  = {StoryDALL-E: Adapting Pretrained Text-to-Image Transformers for Story Continuation},
  author = {Adyasha Maharana and Darryl Hannan and Mohit Bansal},
  journal= {arXiv preprint arXiv:2209.06192},
  year   = {2022}
}

备注

ECCV 2022 (33 pages; code, data, demo, model card available at https://github.com/adymaharana/storydalle)