中文

SCO-VIST:基于社会交互常识知识的视觉故事生成

计算机视觉与模式识别 2024-02-02 v1 人工智能

摘要

视觉故事生成旨在根据给定的图像序列自动生成连贯的故事。与图像描述等任务不同,视觉故事应包含事实描述、世界观和人类社会常识,以将不相干的元素组合成连贯且引人入胜的、人类可书写的故事。然而,大多数模型在尝试创作故事时主要侧重于应用事实信息和使用分类/词汇外部知识。本文介绍了 SCO-VIST,这是一个将图像序列表示为包含对象和关系的图的框架,其中包含了人类动作动机及其社会交互常识知识。然后,SCO-VIST 利用该表示情节点的图,通过基于语义和出现率的边权重在情节之间建立桥梁。该加权故事图使用 Floyd-Warshall 算法按事件序列生成故事情节。根据自动评估和人工评估,我们提出的框架在视觉基础性、连贯性、多样性和人类特征等多项指标上均表现出优越的故事。

关键词

引用

@article{arxiv.2402.00319,
  title  = {SCO-VIST: Social Interaction Commonsense Knowledge-based Visual Storytelling},
  author = {Eileen Wang and Soyeon Caren Han and Josiah Poon},
  journal= {arXiv preprint arXiv:2402.00319},
  year   = {2024}
}