TARN-VIST:面向视觉叙事的主题感知强化网络
计算机视觉与模式识别
2024-03-19 v1
摘要
作为一项跨模态任务,视觉叙事旨在为有序的图像序列自动生成故事。与图像描述任务不同,视觉叙事不仅需要对图像中物体之间的关系进行建模,还需要挖掘相邻图像之间的联系。近期的方法主要利用端到端框架或多阶段框架来生成相关故事,但它们通常忽略了潜在的主题信息。在本文中,为了生成更连贯且相关的故事,我们提出了一种新颖的方法——面向视觉叙事的主题感知强化网络(TARN-VIST)。具体而言,我们从视觉和语言两个角度预提取了故事的主题信息。然后,我们应用两个主题一致的强化学习奖励来识别生成故事与人类标注故事之间的差异,从而优化整个生成过程。在 VIST 数据集上的大量实验结果和人工评估表明,我们提出的模型在多个评估指标上优于大多数竞争模型。
引用
@article{arxiv.2403.11550,
title = {TARN-VIST: Topic Aware Reinforcement Network for Visual Storytelling},
author = {Weiran Chen and Xin Li and Jiaqi Su and Guiqian Zhu and Ying Li and Yi Ji and Chunping Liu},
journal= {arXiv preprint arXiv:2403.11550},
year = {2024}
}