中文

EgoCoT-Bench:面向 MLLMs 的以操作为中心的链式思考推理的基准测试

计算机视觉与模式识别 2026-05-20 v1 人工智能

摘要

多模态大语言模型(MLLMs)的快速发展催生了对以人身视角进行的 egocentric 视频理解需求,尤其是能够识别细粒度手部-物体交互、追踪物体随时间变化的状态,并从动态环境中推理关于操作过程的因果关系。然而,现有 egocentric 视频基准测试存在 \textbf{评估依据局限} 的问题,难以支持细粒度的操作导向推理,更少考察模型推理是否基于明确的时空证据。为填补这一空白,我们提出 \textbf{EgoCoT-Bench}——一个基于明确分步理由注释的、用于验证的操作导向推理的细粒度 egocentric 基准测试。总体而言,EgoCoT-Bench 包含 351 个 egocentric 视频的 3,172 组可验证 QA 对,划分为四大任务组,共 12 子任务组,涵盖感知与回顾、预判与高层推理。基准测试通过基于时空场景图(STSG)的生成框架构建,经人工标注者进一步细化,确保正确性、egocentric 相关性和细粒度质量。实验结果表明,egocentric 细粒度推理仍面临挑战,进一步揭示许多多模态模型虽生成答案正确,却其证据与答案不符。我们期望 EgoCoT-Bench 能为 egocentric 视频理解中的可 grounding 且可验证推理提供有用测试平台。项目页面及补充材料可在 https://dstardust.github.io/EgoCoT/ 查阅。

关键词

引用

@article{arxiv.2605.19559,
  title  = {EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs},
  author = {Yang Dai and Dian Jiao and Tianwei Lin and Wenqiao Zhang},
  journal= {arXiv preprint arXiv:2605.19559},
  year   = {2026}
}