StoryReasoning 数据集:使用链式思考进行场景理解和 grounded 故事生成
计算机视觉与模式识别
2025-09-03 v2 计算与语言
摘要
视觉叙事系统在帧之间维持角色身份并将动作链接到 appropriate 主体方面常常困难,导致 referencial hallucinations。通过对角色、物体及其他实体在视觉元素上的 grounding 可以解决这些问题。我们提出 StoryReasoning,包含 4,178 个故事,源自 52,016 部电影图像,包含结构化场景分析和 grounded 故事。每个故事在帧之间保持角色和物体一致性,同时通过结构化表格表示显式建模多帧关系。我们的做法包括使用视觉相似性和面部识别进行跨帧物体 re-identification,使用链式思考进行显式叙事建模,以及将文本元素链接到视觉实体的 grounding scheme。我们通过在 Qwen2.5-VL 7B 上进行微调建立基准性能,创建 Qwen Storyteller,该模型在 end-to-end object detection、re-identification和 landmark detection 同时保持一致的对象参考。评估显示平均每部故事中 hallucinations 从 4.06 降至 3.56(下降 12.3%),在创造性方面从 2.58 提升至 3.38(提升 31.0%)。
关键词
引用
@article{arxiv.2505.10292,
title = {StoryReasoning Dataset: Using Chain-of-Thought for Scene Understanding and Grounded Story Generation},
author = {Daniel A. P. Oliveira and David Martins de Matos},
journal= {arXiv preprint arXiv:2505.10292},
year = {2025}
}
备注
31 pages, 14 figures