中文

OSIL:基于非偏好轨迹推断安全性的离线安全模仿学习

机器学习 2026-02-12 v1 人工智能 机器学习

摘要

本工作解决离线安全模仿学习(IL)的问题,即从没有 per-timestep 安全成本或奖励信息的演示中学习安全且奖励最大化的策略。在许多实际场景中,环境中的在线学习可能具有风险,指定准确的安全成本也不容易。然而,经常可行的是收集反映不希望或不安全行为的轨迹,这些轨迹隐式地传递了代理人应避免什么。我们提出一种新颖的离线安全 IL 算法 OSIL,通过推断非偏好演示来推断安全性。我们将安全策略学习表述为受约束的马尔可夫决策过程(CMDP)。OSIL 不依赖显式的安全成本和奖励标注,而是通过推导奖励最大化目标的下界,并学习一种估计非偏好行为可能性的成本模型。我们的ethods 允许代理人仅从离线演示中学习安全且奖励最大化的行为。我们经验性地展示了我们的做法能够学习更安全的策略,满足成本约束且不降低奖励性能,从而优于多个基线方法。

关键词

引用

@article{arxiv.2602.11018,
  title  = {OSIL: Learning Offline Safe Imitation Policies with Safety Inferred from Non-preferred Trajectories},
  author = {Returaj Burnwal and Nirav Pravinbhai Bhatt and Balaraman Ravindran},
  journal= {arXiv preprint arXiv:2602.11018},
  year   = {2026}
}

备注

21 pages, Accepted at AAMAS 2026