VIST-GPT:引爆视觉叙事时代的大语言模型?
计算与语言
2025-06-11 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
视觉叙事是一种结合计算机视觉和自然语言处理的跨学科领域,用于从图像序列生成连贯的叙事。本文提出了一种新方法,利用多模态模型的最新进展,具体地调整基于变换器的架构和大规模多模态模型,用于视觉叙事任务。依托大规模视觉叙事(VIST)数据集,我们的 VIST-GPT 模型生成具有视觉依托且情境恰当的叙事。我们解决了传统评估指标(如 BLEU、METEOR、ROUGE 和 CIDEr)在此任务上的局限性。相反,我们利用 RoViST 和 GROOVIST,这两种新颖的无参考指标,用于评估视觉叙事,聚焦于视觉 grounding、连贯性和非冗余性。这些指标对叙事质量提供了更细致的评估,与人类判断高度一致。
引用
@article{arxiv.2504.19267,
title = {VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?},
author = {Mohamed Gado and Towhid Taliee and Muhammad Memon and Dmitry Ignatov and Radu Timofte},
journal= {arXiv preprint arXiv:2504.19267},
year = {2025}
}