X-Loco:通过综合策略蒸馏实现通用人oid locomotion 控制
机器人学
2026-03-05 v1
摘要
虽然近期进展在单个人oid 技能如直立 locomotion、跌倒恢复和全身协调方面表现突出,但要学习掌握所有这些技能的单个策略仍具有挑战性 due to 所涉及的多样化动力学和冲突控制目标。为此,我们引入 X-Loco,一个用于训练基于视觉的通用人oid locomotion 策略的框架。X-Loco 训练多个 oracle 专家策略,并采用 case-adaptive 专家选择机制进行综合策略蒸馏,该机制动态地利用多个专家策略来指导基于视觉的学生策略。这种设计使学生能够获取从跌倒恢复到地形遍历和全身协调技能的广泛技能 spectrum。鉴于目前尚无人能够实现基于视觉的人oid locomotion 同时集成直立 locomotion、全身协调和跌倒恢复,并且仅凭速度命令即可实现,而无需依赖参考运动。实验结果表明,X-Loco 在跌倒恢复和地形遍历等任务中实现了优异性能。消融研究进一步表明,我们的框架有效地利用了专家知识并提高了学习效率。
引用
@article{arxiv.2603.03733,
title = {X-Loco: Towards Generalist Humanoid Locomotion Control via Synergetic Policy Distillation},
author = {Dewei Wang and Xinmiao Wang and Chenyun Zhang and Jiyuan Shi and Yingnan Zhao and Chenjia Bai and Xuelong Li},
journal= {arXiv preprint arXiv:2603.03733},
year = {2026}
}