中文

基于对比学习的教师对齐表示(TAR)用于四足动力学

机器人学 2025-12-02 v2 机器学习 系统与控制 系统与控制

摘要

四足动力学通常通过强化学习(RL)解决,采用教师-学生范式,其中特权教师指导自主感知学生策略。然而,由于教师与自主感知学生之间的表示错位、基于行为克隆的协变量漂移以及缺乏可部署的适应性,导致在实际场景中泛化性能差。我们提出基于对比学习的教师对齐表示(TAR),该框架利用特权信息通过自监督对比学习来弥合这一差距。通过对比目标对齐表示到特权教师,学生策略学习到结构化的潜在空间,并在超出分布(OOD)场景中表现出鲁棒性,优于完全特权的“教师”。结果显示,与最先进的基线方法相比,TAR 实现训练加速 2 倍以实现峰值性能。OOD 场景的平均泛化性能比现有方法提高 40%。此外,TAR 能无缝过渡到部署中的学习,无需特权状态,为高效、自适应的 locomotion 和实施持续微调树立了新基准。开源代码和视频可在 https://amrmousa.com/TARLoco/ 查看。

关键词

引用

@article{arxiv.2503.20839,
  title  = {TAR: Teacher-Aligned Representations via Contrastive Learning for Quadrupedal Locomotion},
  author = {Amr Mousa and Neil Karavis and Michele Caprio and Wei Pan and Richard Allmendinger},
  journal= {arXiv preprint arXiv:2503.20839},
  year   = {2025}
}

备注

This work has been accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025