Real-DRL:在现实世界中教学与学习
机器人学
2025-11-04 v1 人工智能
摘要
本文介绍了 Real-DRL 框架,用于安全关键的自主系统,使其能够在真实工厂(即要控制的物理系统)中开发安全且高性能的动作策略,同时优先保证安全。Real-DRL 由三个交互组件组成:DRL-Student、PHY-Teacher 和 Trigger。DRL-Student 是一种创新的 DRL 智能体,其在双重自学习和教学-学习范式以及实时安全信息批次抽样方面进行了创新。另一方面,PHY-Teacher 基于物理模型的设计,专注于安全关键功能。PHY-Teacher 在两个关键任务方面具有创新性:i)促进 DRL-Student 的教学-学习范式,ii)为真实工厂提供安全保障。Trigger 管理 DRL-Student 和 PHY-Teacher 之间的交互。凭借这三个交互组件,Real-DRL 能够有效应对来自未知未知以及仿真到现实差距的安全挑战。此外,Real-DRL 具有 i) 保证安全,ii) 自动层次学习(即安全优先学习,然后进行高性能学习), iii) 安全信息批次抽样以解决由角落案例导致的学习经验不平衡问题。实验包括真实四足机器人、NVIDIA Isaac Gym 中的四足机器人和 cart-pole 系统,以及比较和消融研究,均表明 Real-DRL 的有效性和独特特性。
引用
@article{arxiv.2511.00112,
title = {Real-DRL: Teach and Learn in Reality},
author = {Yanbing Mao and Yihao Cai and Lui Sha},
journal= {arXiv preprint arXiv:2511.00112},
year = {2025}
}
备注
37 pages