视觉写作提示:基于角色支撑与精选图像序列的故事生成
计算与语言
2023-01-23 v1 计算机视觉与模式识别
机器学习
摘要
当前基于图像的故事生成工作受制于现有图像序列集合背后缺乏连贯情节这一问题。我们通过构建一个新的图像支撑数据集 Visual Writing Prompts (VWP) 来改进视觉故事生成。VWP 包含近 2K 个精选的电影镜头序列,每个序列包括 5-10 张图像。这些图像序列与总共 12K 个故事相对齐,这些故事是通过众包方式,在给定图像序列及来自相应图像序列的一组支撑角色的条件下收集得到的。我们新的图像序列收集与过滤过程使得所获得的故事相比先前工作具有更好的连贯性与叙事性。我们还提出了一个以角色为基础、由连贯性驱动的故事生成模型作为强基线。评估表明,我们生成的故事比当前最先进模型生成的故事更连贯、更具视觉支撑性,且叙事性更强。
引用
@article{arxiv.2301.08571,
title = {Visual Writing Prompts: Character-Grounded Story Generation with Curated Image Sequences},
author = {Xudong Hong and Asad Sayeed and Khushboo Mehra and Vera Demberg and Bernt Schiele},
journal= {arXiv preprint arXiv:2301.08571},
year = {2023}
}
备注
Paper accepted by Transactions of the Association for Computational Linguistics (TACL). This is a pre-MIT Press publication version. 15 pages, 6 figures