EgoThinker:基于时空链思的揭示自我中心推理
计算机视觉与模式识别
2025-10-28 v1
摘要
自我中心视频推理聚焦于摄像机后方的不可观测智能体如何动态塑造环境,这需要推断隐藏意图并识别细粒度互动。这个核心挑战限制了当前多模态大语言模型(MLLMs)的表现,后者在可见事件推理方面表现出色,但缺乏具身、第一人称的理解。为弥合这一差距,我们引入EgoThinker,一个新型框架,通过时空链思监督和两阶段学习课程为MLLMs提供强大的自我中心推理能力。首先,我们构建了EgoRe-5M,一个来自1300万个多样化自我中心视频片段的大规模自我中心问答数据集。该数据集包含具有详细链思理由和稠密手-物 grounding 的多分钟片段。其次,我们对EgoRe-5M进行SFT,以灌输推理技能,然后通过RFT进一步增强时空局部化。实验结果表明,EgoThinker在多个自我中心基准测试中超越现有方法,同时在细粒度时空局部化任务中实现显著提升。我们在https://github.com/InternRobotics/EgoThinker上发布了完整代码和数据。
引用
@article{arxiv.2510.23569,
title = {EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT},
author = {Baoqi Pei and Yifei Huang and Jilan Xu and Yuping He and Guo Chen and Fei Wu and Yu Qiao and Jiangmiao Pang},
journal= {arXiv preprint arXiv:2510.23569},
year = {2025}
}
备注
Accepted at NeurIPS 2025