中文

每图皆述一故事:基于图像可控风格化故事生成

计算与语言 2022-09-13 v2

摘要

由图像生成短故事是一项艰巨任务。与图像描述不同,由图像生成故事面临多重挑战:保持故事连贯性、恰当评估故事质量、将生成故事引导至特定风格,以及缓解图像-故事配对参考数据集稀缺所导致的训练监督受限问题。本工作中,我们提出即插即用故事讲述器 (PPST),并通过以下方式改进图像到故事的生成:1) 通过引入大型预训练模型(即 CLIP 与 GPT-2)缓解数据稀缺问题,以最小监督促进流畅的图像到文本生成;2) 通过引入风格适配器控制故事生成,实现更具风格相关性的生成。我们使用非风格化、浪漫风格化与动作风格化的 PPST 方法进行图像到故事生成实验,并从故事连贯性、图像-故事相关性及风格契合度三方面,采用自动与人工评估将生成故事与已有工作进行比较。结果表明 PPST 改善了故事连贯性并具有更好的图像-故事相关性,但尚不够风格化。

关键词

引用

@article{arxiv.2209.01638,
  title  = {Every picture tells a story: Image-grounded controllable stylistic story generation},
  author = {Holy Lovenia and Bryan Wilie and Romain Barraud and Samuel Cahyawijaya and Willy Chung and Pascale Fung},
  journal= {arXiv preprint arXiv:2209.01638},
  year   = {2022}
}

备注

Accepted in LaTeCH-CLfL 2022 (6th Joint SIGHUM Workshop on Computational Linguistics for Cultural Heritage, Social Sciences, Humanities and Literature), COLING 2022