UniT: 面向人类-人oid策略学习与世界建模的统一物理语言
机器人学
2026-04-22 v1 人工智能
摘要
人oid基础模型的规模化受限于机器人数据的稀缺。虽然大规模环视人类数据提供了可扩展的替代方案,但由于运动学不匹配,跨 embodiment 的桥接仍是根本性挑战。我们引入 UniT(统一的潜在动作分词器通过视觉锚定),构建一个用于人类-人oid迁移的统一物理语言框架。基于异构运动学共享普遍视觉后果的哲学,UniT 采用三分支交叉重构机制:动作预测视觉以将运动学锚定到物理结果,同时视觉重构动作以过滤无关视觉干扰因素。并行地,融合分支将这些净化后的模态融合到共享的、与 embodiment 无关的物理意图离散潜在空间中。我们在两个范式中验证了 UniT:1)策略学习(VLA-UniT):通过预测这些统一令牌,它有效地利用多样化的人类数据实现了数据效率最高且对 OOD(域外)泛化稳健的状态,在人类oid仿真基准和真实部署中均取得最先进成果,尤其展示了零样本任务迁移。2)世界建模(WM-UniT):通过将统一令牌作为条件对齐跨 embodiment 的动力学,实现了直接的人类-人oid动作迁移。这种对齐确保了人类数据无缝转化为人类oid视频生成的增强动作可控性。最终,通过诱导高度对齐的跨 embodiment 表示(经 t-SNE 可视化验证,人类和人类oid特征收敛到共享流形),UniT 为将大规模人类知识蒸馏为通用人类oid能力提供了可扩展的路径。
引用
@article{arxiv.2604.19734,
title = {UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling},
author = {Boyu Chen and Yi Chen and Lu Qiu and Jerry Bai and Yuying Ge and Yixiao Ge},
journal= {arXiv preprint arXiv:2604.19734},
year = {2026}
}
备注
Project page: https://xpeng-robotics.github.io/unit/