中文

Long-CODE:将纯长程情境隔离为视频评估的正交维度

计算机视觉与模式识别 2026-04-21 v1 人工智能

摘要

随着视频生成模型取得突破性进展,对鲁棒性视频评估指标的需求日益增长。传统指标本质上针对短视频评估进行设计,主要评估帧级视觉质量和局部时序平滑性。然而,随着最新视频生成模型扩展到生成更长视频,这些指标难以捕捉诸如叙事丰富性和全局因果一致性等关键长程特征。我们认识到,短期视觉感知与长程情境属性是根本上正交的两个维度,因此长视频评估指标应与短视频评估相互独立。在本文中,我们聚焦于为长视频评估构建严谨的框架。我们首先引入一套长视频属性损坏测试,揭示了现有短视频指标对结构性不一致(如镜头级 perturbations 和叙事乱序)敏感性不足的关键局限。为弥合这一差距,我们设计了一种基于镜头动态的新型长视频指标,该指标对长程测试框架高度敏感。此外,我们提出了Long-CODE(Long-Context as an Orthogonal Dimension for video Evaluation),即为评估长视频而构建的专门数据集,专为捕捉真正的长程特征而进行的人类标注。大量实验表明,我们提出的指标在与人类判断相关性方面实现了最先进的水平。最终,我们的指标和基准数据集无缝地补充了现有的短视频标准,构建了用于视频生成模型的整体且无偏的评估范式。

关键词

引用

@article{arxiv.2604.17428,
  title  = {Long-CODE: Isolating Pure Long-Context as an Orthogonal Dimension in Video Evaluation},
  author = {Zhijiang Tang and Jiaxin Qi and Bing Zhao and Jianqiang Huang},
  journal= {arXiv preprint arXiv:2604.17428},
  year   = {2026}
}