ProcObject-10K:面向指令视频中对象中心procedural理解的基准
计算机视觉与模式识别
2026-05-11 v2
摘要
procedur 行为本质上由对象状态转换驱动,但现有指令视频基准仍以动作为中心,无法评估模型是否推理对象如何演化以完成任务。本文引入 ProcObject-10K,这是第一个同时评估指令视频中对象中心推理和时间证据 grounding 的基准,覆盖 egocentric 与 exocentric 两种视角。其包含 10,522 对开放式 VideoQA 问答对,基于 1,799 个视频片段,涵盖 137 项任务、9 个领域及五类推理类型(前提、状态演化、反事实、错误、就绪状态)。对 13 种主流 MLLMs 进行基准测试后发现,存在显著的 answering-grounding 差距:模型会生成合理答案,却未能定位支持证据(mIoU < 45%),暴露其依赖语言先验而非对对象细粒度动态的依赖。为弥合此差距,本文进一步提供一种基于伪对象级监督和时空约束的对象中心监督微调基线。在 ProcObject-10K 上微调的模型不仅在该基准上取得改进,还能有效迁移至其他 grounding VideoQA 和具身规划任务。该数据集、标注及评估工具将公开释放,以支持未来研究对象中心procedural理解。
引用
@article{arxiv.2512.03479,
title = {ProcObject-10K: Benchmarking Object-Centric Procedural Understanding in Instructional Videos},
author = {Wenliang Guo and Yu Kong},
journal= {arXiv preprint arXiv:2512.03479},
year = {2026}
}