(尚未)完整的故事:评估视觉叙事需要超过衡量连贯性、 grounding 与重复
计算与语言
2024-10-28 v4 人工智能
计算机视觉与模式识别
机器学习
摘要
视觉叙事是根据时间顺序的图像序列生成自然语言故事的任务。这一任务不仅对模型具有挑战性,也非常困难以自动评估,因为没有关于何为“好”故事的共识。本文引入一种新方法,将故事质量衡量为关于三个关键方面的人类似程度:视觉 grounding、连贯性与重复性。我们使用此方法评估了几个模型生成的故事,结果显示基础模型 LLaVA 获得了最佳结果,但仅略胜于 TAPM——一个 50 倍更小的视觉叙事模型。升级 TAPM 的视觉与语言组件后,得到的模型在参数相对较少的情况下表现出竞争力。最后,我们进行了人类评估研究,其结果表明,“好”故事可能需要超过人类水平的视觉 grounding、连贯性与重复性。
引用
@article{arxiv.2407.04559,
title = {Not (yet) the whole story: Evaluating Visual Storytelling Requires More than Measuring Coherence, Grounding, and Repetition},
author = {Aditya K Surikuchi and Raquel Fernández and Sandro Pezzelle},
journal= {arXiv preprint arXiv:2407.04559},
year = {2024}
}
备注
In proceedings of EMNLP 2024 (Findings)