中文

面向上下文感知的视觉叙事:基于视觉前缀调优和对比学习

计算与语言 2024-08-13 v1 计算机视觉与模式识别

摘要

视觉叙事系统从图像序列生成多句子叙事。在此任务中,捕获上下文信息和桥接视觉变化带来额外挑战。我们提出一种简单且有效的框架,利用预训练基础模型的泛化能力,仅训练轻量级的视觉-语言映射网络以连接模态,同时融入上下文以增强连贯性。我们引入一种多模态对比目标,也可提高视觉相关性和叙事信息性。大量实验结果,涵盖自动度量和人类评估,表明我们框架生成的叙事具有多样性、连贯性、信息性和趣味性。

关键词

引用

@article{arxiv.2408.06259,
  title  = {Context-aware Visual Storytelling with Visual Prefix Tuning and Contrastive Learning},
  author = {Yingjin Song and Denis Paperno and Albert Gatt},
  journal= {arXiv preprint arXiv:2408.06259},
  year   = {2024}
}

备注

18 pages, 12 figures, accepted by INLG 2024