Nightmare Dreamer:梦见不安全状态并提前规划
机器学习
2026-01-09 v1 机器人学
摘要
强化学习(RL)在现实世界应用中展现出了显著的成功,尤其是在机器人控制领域。然而,由于缺乏充分的安全保证,RL 的应用仍然有限。我们提出了 Nightmare Dreamer,这是一种基于模型的安全 RL 算法,通过利用学习到的世界模型来预测潜在的安全违规并据此规划动作,从而解决安全问题。Nightmare Dreamer 在最大化奖励的同时实现了近乎零的安全违规。在 Safety Gymnasium 任务上,Nightmare Dreamer 仅使用图像观测就优于无模型基线,效率提升了近 20 倍。
引用
@article{arxiv.2601.04686,
title = {Nightmare Dreamer: Dreaming About Unsafe States And Planning Ahead},
author = {Oluwatosin Oseni and Shengjie Wang and Jun Zhu and Micah Corah},
journal= {arXiv preprint arXiv:2601.04686},
year = {2026}
}
备注
RSS'25: Multi-Objective Optimization and Planning in Robotics Workshop: 5 pages, 8 figures