中文

仅文本训练的视觉叙事方法

计算机视觉与模式识别 2023-08-21 v1

摘要

视觉叙事旨在基于图像序列生成叙事,需要视觉-语言对齐和连贯故事生成。大多数现有方案主要依赖配对的图像-文本训练数据,这类数据收集成本高且难以扩展。为此,我们将视觉叙事表述为视觉条件下的故事生成问题,并提出一种仅文本训练方法,将跨模态对齐与故事生成的学习分离开来。我们的方法特别利用跨模态预训练的 CLIP 模型将视觉控制整合到仅在文本数据上训练的故事生成器中。此外,我们设计了一个无需训练的视觉条件规划器,在考虑输入图像序列时间结构的同时平衡全局与局部视觉内容。仅需文本数据训练的显著优势使我们的方法能够从外部文本故事数据中学习,增强视觉叙事的泛化能力。我们在 VIST 基准上进行了大量实验,展示了我们的方法在域内和跨域设置中的有效性。在表达多样性和人工评估上的进一步评测凸显了我们的方法在信息量和鲁棒性方面的优越性。

关键词

引用

@article{arxiv.2308.08881,
  title  = {Text-Only Training for Visual Storytelling},
  author = {Yuechen Wang and Wengang Zhou and Zhenbo Lu and Houqiang Li},
  journal= {arXiv preprint arXiv:2308.08881},
  year   = {2023}
}

备注

ACM MM 2023