中文

具有实时预算约束的安全离线强化学习

机器学习 2024-03-05 v2 人工智能 机器人学

摘要

为推动强化学习(RL)在安全真实世界部署中的应用,安全RL研究近年来取得显著进展。然而,现有文献中多数工作仍聚焦于在线设定,训练过程中很可能发生对安全预算的风险性违背。此外,在许多真实应用中,所学策略需实时响应动态确定的安全预算(即约束阈值)。本文针对离线设定下的上述实时预算约束问题,提出基于轨迹的实时预算推断(TREBI)作为一种新颖解决方案,从轨迹分布视角建模该问题并通过扩散模型规划求解。理论上,我们证明了离线设定下片段奖励与代价的估计误差界,从而为其提供性能保证。在广泛仿真任务及真实大规模广告应用上的实证结果展示了TREBI解决离线设定下实时预算约束问题的能力。

关键词

引用

@article{arxiv.2306.00603,
  title  = {Safe Offline Reinforcement Learning with Real-Time Budget Constraints},
  author = {Qian Lin and Bo Tang and Zifan Wu and Chao Yu and Shangqin Mao and Qianlong Xie and Xingxing Wang and Dong Wang},
  journal= {arXiv preprint arXiv:2306.00603},
  year   = {2024}
}

备注

We propose a method to handle the constraint problem with dynamically determined safety budgets under the offline setting