中文

面向实例感知开放域视觉叙事的大规模数据集与基准:Openstory++

计算机视觉与模式识别 2024-08-08 v1

摘要

最近的图像生成模型在从简短标题创建高质量图像方面表现出色。然而,当遇到冗长上下文时,它们会无法在多个图像之间维持多个实例的一致性。这一不一致性主要归因于现有训练数据集缺乏粒略的实例特征标注。为解决此问题,我们引入Openstory++,一个结合了额外实例级标注的大规模数据集,包含图像和文本。此外,我们发展了一种强调以实体为中心的图像-文本生成训练方法,确保模型有效地将视觉和文本信息交织在一起。具体而言,Openstory++简化了从开放域视频中提取关键帧的过程,采用视觉-语言模型生成标题,然后由大型语言模型润色以确保叙事连贯性。它超越了之前数据集的范围,包含自动标题生成、针对实例数量的高分辨率图像,以及用于时间一致性的大量帧序列。此外,我们提出Cohere-Bench,一个用于评估在提供长多模态上下文时图像生成任务的先驱性基准框架,包括保持背景、风格、实例在给定上下文中一致的能力。与现有基准相比,我们的工作填补了多模态生成的关键空白,推动了能够熟练处理开放域环境中复杂叙事的模型发展。Cohere-Bench中的实验确认了Openstory++在培育高质量视觉叙事模型方面的优势,增强了其解决开放域生成任务的能力。更多细节可在 https://openstorypp.github.io/ 查看。

关键词

引用

@article{arxiv.2408.03695,
  title  = {Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual Storytelling},
  author = {Zilyu Ye and Jinxiu Liu and Ruotian Peng and Jinjin Cao and Zhiyang Chen and Yiyang Zhang and Ziwei Xuan and Mingyuan Zhou and Xiaoqian Shen and Mohamed Elhoseiny and Qi Liu and Guo-Jun Qi},
  journal= {arXiv preprint arXiv:2408.03695},
  year   = {2024}
}