DoublyAware:面向人oid locomotion 的双重规划与策略感知时序差学习
机器人学
2025-06-17 v1
摘要
在模型基准强化学习 (MBRL) 中,实现人oid locomotion 的稳健机器人学习是根本性挑战,环境随机性和随机性会阻碍高效探索和学习稳定性。环境即所谓的 aleatoric 不确定性在高维动作空间中伴随复杂接触动力学时可能被放大,并进一步与建模阶段的 epistemic 不确定性交织。在本工作中,我们提出了 DoublyAware,这是时序差模型预测控制 (TD-MPC) 的一种不确定性感知扩展,通过显式分解为两个互不相交且可解释的组成部分,即规划不确定性和策略不确定性。为处理规划不确定性,DoublyAware 采用共轭预测方法,以分位数校准的风险界限筛选候选轨迹,确保统计一致性和对随机动力学的稳健性。同时,利用策略滚动路径作为结构化的先验信息,以群基相对策略约束 (GRPC) 优化器支持学习阶段,在潜在动作空间中施加基于群的自适应信任区域。这一原则性组合使机器人智能体能够优先考虑高置信度、高奖励行为,同时在不确定性下保持有效的、有针对性的探索。评估于 HumanoidBench locomotion 测试套件,采用 Unitree 26-DOF H1-2 人oid,DoublyAware 在样本效率、收敛速度和运动可行性方面均优于 RL 基线。我们的仿真结果凸显了结构化不确定性建模在 TD-MPC 基于人oid locomotion 学习中数据高效和可靠决策中的重要性。
引用
@article{arxiv.2506.12095,
title = {DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion},
author = {Khang Nguyen and An T. Le and Jan Peters and Minh Nhat Vu},
journal= {arXiv preprint arXiv:2506.12095},
year = {2025}
}