Being-H0.7:从第三人称视角视频中学习的潜在世界-动作模型
机器人学
2026-05-04 v1 计算机视觉与模式识别
机器学习
摘要
视觉-语言-动作模型(VLA)通过将多模态观察和语言指令直接映射到动作,推动了通用机器人控制的进展,但稀疏动作监督往往会鼓励捷径映射,而非动态、接触和任务进度的表征。最近的世界-动作模型通过视频滚动引入未来预测,但像素空间的预测是控制的代价高且间接的基质,因为它可能建模与动作生成无关的视觉细节,并引入显著的训练或推理开销。我们提出Being-H0.7,一种潜在世界-动作模型,通过无需生成未来帧的方式将未来感知理性引入VLA风格的策略中。Being-H0.7在感知与动作之间插入可学习的潜在查询,作为紧凑的推理接口,并通过一种未来感知的双分支设计进行训练:一个可部署的先验分支从当前上下文中推断潜在状态,而训练-only后验分支则将查询替换为来自未来观察的嵌入。通过在潜在推理空间中联合对齐两个分支,引导先验分支仅从当前观察中推理出未来感知、动作有用的结构。在推理时,Being-H0.7丢弃后验分支,不进行任何视觉滚动。实验在六个仿真基准和多样化真实任务中表明,Being-H0.7实现了最先进或相当于当前水平的性能,融合了世界模型的预测优势与直接VLA策略的效率和可部署性。
引用
@article{arxiv.2605.00078,
title = {Being-H0.7: A Latent World-Action Model from Egocentric Videos},
author = {Hao Luo and Wanpeng Zhang and Yicheng Feng and Sipeng Zheng and Haiweng Xu and Chaoyi Xu and Ziheng Xi and Yuhui Fu and Zongqing Lu},
journal= {arXiv preprint arXiv:2605.00078},
year = {2026}
}