NarrativeTrack:评估叙事理解中的实体中心推理
计算机视觉与模式识别
2026-03-31 v2 机器学习
摘要
多模态大语言模型(MLLMs)在视觉语言推理方面取得了显著进展,但其理解视频中随时间展开的叙事能力尚未得到充分探索。真正的叙事理解需要在时空语境中对谁在何时何地做某事进行 grounding,并在动态视觉和时间环境中维持连贯的实体表示。我们引入 NarrativeTrack,作为评估 MLLMs 叙事理解的基准,聚焦于细粒度的实体中心推理。不同于现有仅限于短片段或粗糙场景层次语义的基准,NarrativeTrack 将视频分解为组成性实体,并通过分量推理 progression(CRP)框架评估其连续性,该框架在三个维度上逐步增加叙事复杂度:实体存在、实体变化和实体模糊。CRP 挑战模型从时间持久性发展到情境演化,再到细粒度感知推理。完全自动化的实体中心管道 enables 从可扩展的方式提取时空 grounding 的实体表示,为 CRP 提供了基础。对最新 MLLMs 的评估显示,这些模型在视觉转换和时间动态中跟踪实体时表现不稳,常在情境变化下产生幻觉。开放源的通用 MLLMs 在感知 grounding 方面表现强劲,但在时序连贯性方面较弱;视频特定 MLLMs 捕获时序情境但对实体情境产生幻觉。这些发现揭示了感知 grounding 与时序推理之间的根本性权衡,表明叙事理解只有在两者集成后才能实现。NarrativeTrack 提供了系统性框架,以诊断和推进 MLLMs 时空 grounding 叙事理解。
引用
@article{arxiv.2601.01095,
title = {NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding},
author = {Hyeonjeong Ha and Jinjin Ge and Bo Feng and Kaixin Ma and Gargi Chakraborty},
journal= {arXiv preprint arXiv:2601.01095},
year = {2026}
}
备注
Project Page: https://github.com/apple/ml-NarrativeTrack