CAST:用于一致视频检索的视觉状态转换建模
计算机视觉与模式识别
2026-03-10 v1
摘要
随着视频内容创建向长篇叙事转变, 将短片段组合成连贯的情节线索变得越来越重要。然而,现有的检索公式在推理阶段仍然是上下文不敏感的,侧重于局部语义对齐,忽略了状态和身份的一致性。为解决这一结构性限制,我们正式化了一致视频检索(Consistent Video Retrieval, CVR)任务,并引入了一个横跨 YouCook2、COIN 和 CrossTask 的诊断基准。我们提出了 CAST(Context-Aware State Transition),一种轻量级、即插即用的适配器,兼容多种冻结的视觉语言嵌入空间。通过预测来自视觉历史的状态条件残差更新(),CAST 引入了对潜在状态演化的显式归纳偏置。大量实验表明,CAST 在 YouCook2 和 CrossTask 上性能提升, 在 COIN 上保持竞争力,并且在多样化基础模型上始终优于零样本基线。此外,CAST 为黑盒视频生成候选者(例如来自 Veo 的候选)提供了有用的重新排序信号,促进更具时序一致性的 continuations。
引用
@article{arxiv.2603.08648,
title = {CAST: Modeling Visual State Transitions for Consistent Video Retrieval},
author = {Yanqing Liu and Yingcheng Liu and Fanghong Dong and Budianto Budianto and Cihang Xie and Yan Jiao},
journal= {arXiv preprint arXiv:2603.08648},
year = {2026}
}