中文

WAM-TTT:通过观察人类游戏在测试时引导世界动作模型

机器人学 2026-07-08 v1 人工智能

摘要

将机器人基础模型(RFM)引导至新的任务变体或用户偏好的行为仍然具有挑战性,通常需要额外的机器人演示、特定任务的微调或长上下文条件设定。我们提出了 WAM-TTT,一个从原始人类视频中引导世界动作模型的测试时训练框架。WAM-TTT 不是将人类视频视为要模仿的轨迹,而是通过自监督视频预测将它们吸收到冻结的 WAM 内部的轻量级自适应记忆中。为了使这种记忆对控制有用,我们引入了一个元训练阶段,该阶段使用配对的人-机器人数据和键值记忆重建目标来对齐人类演示与机器人行为。在测试时,只需要未标记的人类视频来适应记忆,而预训练的 WAM 保持冻结。这使得无需机器人动作、人类侧注释或特定任务微调即可实现高效且可复用的引导,同时保持了基础模型的泛化能力。大量实验表明,WAM-TTT 在多种操作任务和泛化设置中始终优于上下文人类视频条件基线。

关键词

引用

@article{arxiv.2607.06988,
  title  = {WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time},
  author = {Yusen Feng and Bingchen Han and Jiangran Lyu and Kai Liu and Yixin Zheng and Yuxuan Wan and Weiheng Liu and Sun Han and Ruiqin Li and Yulong Zhang and Fangfu Liu and Xuesong Shi and Libin Liu and Yizhou Wang and Zhizheng Zhang and He Wang},
  journal= {arXiv preprint arXiv:2607.06988},
  year   = {2026}
}