中文

面向 AI 生成视频的基于状态 awareness 的文本到视频检索数据集

计算机视觉与模式识别 2026-03-17 v1 信息检索 多媒体

摘要

现有的文本到视频检索基准主要由真实世界视频组成,其中大量语义可从单帧中推断,使得 temporal reasoning 和 explicit end-state grounding 受到充分考验。我们引入 GenState-AI,一个以 AI 生成视频为中心、聚焦于受控状态转换的数据集,其中每个查询配有一个 main video、一个仅在决定性 end-state 不同步的 temporal hard negative,以及一个内容置换的 semantic hard negative,从而实现对 temporal 与 semantic 混淆(超越外观匹配)的精细诊断。我们使用 Wan2.2-TI2V-5B 生成短片段,其意义取决于位置、数量和对象关系的精确变化,提供了可控的 state-aware 检索评估条件。我们评估了两个代表性的 MLLM-based baseline,发现其一致且可解释的失败模式:两个模型经常将 main video 与 temporal hard negative 混淆,并倾向于选择虽在时间上合理但 end-state 不正确的视频,表明对决定性 end-state 证据的 grounding 不足;相比之下,对 semantic 置换较为敏感。我们进一步引入基于三元组的诊断分析,包括相对顺序统计和跨转换类别的划分,以明确 temporal 与 semantic 失败来源。GenState-AI 为 state-aware、时空和语义敏感的文本到视频检索提供了聚焦测试环境,该数据集将发布在 huggingface.co 上。

关键词

引用

@article{arxiv.2603.14426,
  title  = {GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos},
  author = {Minghan Li and Tongna Chen and Tianrui Lv and Yishuai Zhang and Suchao An and Guodong Zhou},
  journal= {arXiv preprint arXiv:2603.14426},
  year   = {2026}
}