TwiFF (Think With Future Frames):用于动态视觉推理的大规模数据集
计算机视觉与模式识别
2026-02-12 v1 人工智能
摘要
视觉链律思维(VCoT)作为一种新兴范式,正通过将视觉感知整合到中间推理步骤中来增强多模态推理。然而,现有VCoT方法主要局限于静态场景,难以捕捉指令、预测和摄像运动等任务所必需的时序动态特性。为填补这一差距,我们提出TwiFF-2.7M,首个大规模时序导向VCoT数据集,源自270万个视频片段,专为动态视觉问答任务设计。同时,我们引入TwiFF-Bench,包含1078个样本的高质量评估基准,评估开放式动态环境中推理轨迹的合理性以及最终答案的正确性。基于这些基础,我们提出TwiFF模型,一种统一的模型,协同利用预训练视频生成和图像理解能力,生成具有时序一致性的视觉推理线索——迭代生成未来动作帧和文本推理。大量实验表明,TwiFF在动态推理任务上显著优于现有VCoT方法和文本链律思维基线,完全验证了其在动态场景下进行视觉问答有效性。我们的代码和数据可在 https://github.com/LiuJunhua02/TwiFF 获取。
引用
@article{arxiv.2602.10675,
title = {TwiFF (Think With Future Frames): A Large-Scale Dataset for Dynamic Visual Reasoning},
author = {Junhua Liu and Zhangcheng Wang and Zhike Han and Ningli Wang and Guotao Liang and Kun Kuang},
journal= {arXiv preprint arXiv:2602.10675},
year = {2026}
}
备注
preprint