VisualTrans:面向真实世界视觉转换推理的基准
计算机视觉与模式识别
2025-08-07 v1
摘要
视觉转换推理(VTR)是一种关键认知能力,使智能体能够理解动态场景、建模因果关系并预测未来状态,从而指导行动并为先进的智能系统奠定基础。然而,现有基准存在仿真-现实鸿沟、任务复杂度有限以及推理覆盖不完整,限制了其在现实场景中的实际应用。为此,我们引入 VisualTrans,这是第一个专为真实世界人类-对象交互场景中 VTR 设计的全面基准。VisualTrans 涵盖 12 个语义上多样的操纵任务,并通过 6 个明确定义的子任务类型系统地评估了三个essential推理维度——空间、程序和量化。基准包含 472 对高质量问答对,格式多样,包括多选题、开放式计数和目标枚举。我们构建了一个可扩展的数据构建管道,基于第一人称操纵视频,集成任务选择、图像对提取、使用大型多模态模型进行自动元数据标注以及结构化问题生成。人类验证确保最终基准具有高质量和可解释性。对各种最先进视觉-语言模型的评估显示,在静态空间任务中表现良好。然而,它们在动态、多步骤推理场景中存在显著不足,特别是在中间状态识别和转换序列规划等领域。这些发现凸显了时序建模和因果推理中的根本性弱点,为开发更具能力和可迁移性的 VTR 系统提供了明确的研究方向。该数据集和代码已公开于 https://github.com/WangYipu2002/VisualTrans。
引用
@article{arxiv.2508.04043,
title = {VisualTrans: A Benchmark for Real-World Visual Transformation Reasoning},
author = {Yuheng Ji and Yipu Wang and Yuyang Liu and Xiaoshuai Hao and Yue Liu and Yuting Zhao and Huaihai Lyu and Xiaolong Zheng},
journal= {arXiv preprint arXiv:2508.04043},
year = {2025}
}