面向上下文感知的视觉叙事:基于视觉前缀调优和对比学习
计算与语言
2024-08-13 v1 计算机视觉与模式识别
摘要
视觉叙事系统从图像序列生成多句子叙事。在此任务中,捕获上下文信息和桥接视觉变化带来额外挑战。我们提出一种简单且有效的框架,利用预训练基础模型的泛化能力,仅训练轻量级的视觉-语言映射网络以连接模态,同时融入上下文以增强连贯性。我们引入一种多模态对比目标,也可提高视觉相关性和叙事信息性。大量实验结果,涵盖自动度量和人类评估,表明我们框架生成的叙事具有多样性、连贯性、信息性和趣味性。
引用
@article{arxiv.2408.06259,
title = {Context-aware Visual Storytelling with Visual Prefix Tuning and Contrastive Learning},
author = {Yingjin Song and Denis Paperno and Albert Gatt},
journal= {arXiv preprint arXiv:2408.06259},
year = {2024}
}
备注
18 pages, 12 figures, accepted by INLG 2024