面向长视频生成的叙事中心化评估:NarrLV
计算机视觉与模式识别
2026-03-09 v5
摘要
随着基础视频生成技术的快速发展,长视频生成模型因扩大的内容创作空间而展现出巨大的研究潜力。最近的研究表明,长视频生成任务的目标不仅是延长视频时长,还要在更长的视频中准确表达更丰富的叙事内容。然而,由于缺乏专为长视频生成模型设计的评估基准,当前对这些模型的评估主要依赖于简单叙事提示词(如VBench)的基准。据我们所知,NarrLV是首个全面评估长视频生成模型叙事表达能力的基准。灵感来自电影叙事理论,我们首先引入维持视频中连续视觉呈现的基本叙事单元称为Temporal Narrative Atom(TNA),并使用其计数来定量测量叙事丰富度。基于三个影响TNA变化的关键电影叙事元素,我们构建了一个能够产生可灵活扩展TNAs数量的自动化提示词生成管道。然后,根据三个叙事内容表达的渐进层次,我们设计了一个有效的评估指标,使用MLLM-based问答框架。最后,我们在现有长视频生成模型和基础生成模型上进行了广泛的评估。实验结果表明,我们的指标与人类判断高度一致。派生的评估结果揭示了当前视频生成模型在叙事内容表达方面的详细能力边界。
引用
@article{arxiv.2507.11245,
title = {NarrLV: Towards a Comprehensive Narrative-Centric Evaluation for Long Video Generation},
author = {X. Feng and H. Yu and M. Wu and S. Hu and J. Chen and C. Zhu and J. Wu and X. Chu and K. Huang},
journal= {arXiv preprint arXiv:2507.11245},
year = {2026}
}
备注
Project Page: https://amap-ml.github.io/NarrLV-Website/