中文

EgoTL:以 egocentric 思维说出链条用于长期任务

计算机视觉与模式识别 2026-04-13 v1

摘要

大型基础模型在具身智能领域取得了显著进展,使其能够合成和推理 egocentric 输入以处理日常 household 任务。然而,VLM-based auto-labeling 常常噪声较大,因为主要数据来源缺乏准确的人类动作标签、思维说出链条(CoT)和空间注释;这些错误在长期视觉空间指令跟随过程中会被放大。这些问题源于对分钟级日常 household 规划任务覆盖不足以及空间 grounding 不准。结果导致 VLM 推理链和 world-model 合成会产生幻觉对象、跳过步骤,或未能遵守现实中的物理属性。为弥补这些差距,我们引入EgoTL。EgoTL 构建了一个用于 egocentric 数据的思维说出捕获管道。它使用以说在动作前的协议记录逐步目标和口头推理,带有单词级时间戳,然后通过基于指标尺度的空间估计器校准物理属性,利用记忆库漫步获取场景上下文,并使用 clip 级别标签用于导航指令和详细操作动作。通过EgoTL,我们能够在六个任务维度上对 VLMs 和 World Models 进行基准测试,进行跨越 100+ 个日常 household 任务的分钟级序列的长期生成。我们发现,基础模型仍不足以作为 egocentric 助手或开放世界模拟器。最后,我们在EgoTL 训练分割上使用与指标标签对齐的人类 CoT 微调基础模型,提高了长期规划和推理、逐步推理、指令跟随和空间 grounding。

关键词

引用

@article{arxiv.2604.09535,
  title  = {EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks},
  author = {Lulin Liu and Dayou Li and Yiqing Liang and Sicong Jiang and Hitesh Vijay and Hezhen Hu and Xuhai Xu and Zirui Liu and Srinivas Shakkottai and Manling Li and Zhiwen Fan},
  journal= {arXiv preprint arXiv:2604.09535},
  year   = {2026}
}

备注

https://ego-tl.github.io/