Act2Goal:从世界模型到通用目标条件策略
机器人学
2025-12-30 v1 人工智能
摘要
以既具表达性又具精确性的方式指定机器人操作任务仍是核心挑战。虽然视觉目标提供了紧凑且无歧义的任务指定,但现有目标条件策略往往因依赖单步动作预测而难以处理长时序操作,缺乏对任务进度的显式建模。我们提出 Act2Goal,一个集成目标条件视觉世界模型与多尺度时序控制的通用目标条件操作策略。给定当前观察和目标视觉目标,世界模型生成一序列可行的中间视觉状态,捕获长时序结构。为将该视觉计划转化为稳健的执行,我们引入多尺度时序哈希(MSTH),将想象的轨迹分解为密集的近端帧以实现细粒度闭环控制,以及稀疏的远端帧以锚定全局任务一致性。该策略通过端到端交叉注意力将这些表示与动作控制耦合,实现连贯的长时序行为,同时保持对局部干扰的反应性。Act2Goal 在新颖的对象、空间布局和环境方面实现了强大的零样本泛化。我们进一步通过基于 LoRA 的微调实现奖励-free 在线自适应,允许在无外部监督的情况下快速自主改进。真实机器人实验表明,Act2Goal 在挑战性的分布外任务中将成功率从 30% 提升到 90%,在几分钟的自主交互后即可验证,表明具备多尺度时序控制的目标条件世界模型为稳健的长时序操作提供了必要的结构化指导。项目页面:https://act2goal.github.io/
引用
@article{arxiv.2512.23541,
title = {Act2Goal: From World Model To General Goal-conditioned Policy},
author = {Pengfei Zhou and Liliang Chen and Shengcong Chen and Di Chen and Wenzhi Zhao and Rongjun Jin and Guanghui Ren and Jianlan Luo},
journal= {arXiv preprint arXiv:2512.23541},
year = {2025}
}