中文

SafeMIL:从非偏好轨迹中学习离线安全模仿策略

机器学习 2025-11-17 v2 人工智能 机器学习

摘要

本文研究了离线安全模仿学习(IL)的问题。在许多实际场景中,线上交互可能具有风险,难以在每个时间步指定准确的奖励和安全成本信息。然而,收集反映不理想或风险行为的轨迹是可行的,这些轨迹隐式地传递了代理应避免的行为。我们将这些轨迹称为非偏好轨迹。与标准IL旨在模仿演示不同,我们的代理还必须学习如何避免风险行为。本文提出了一种新方法SafeMIL,通过多实例学习(MIL)学习参数化成本,以预测状态-动作对是否为风险。所学成本随后用于避免非偏好行为, resulting in 一个优先考虑安全性的策略。我们通过实证研究表明,该方法能够学习更安全的策略,满足成本约束而不降低奖励性能,从而优于几个基线方法。

关键词

引用

@article{arxiv.2511.08136,
  title  = {SafeMIL: Learning Offline Safe Imitation Policy from Non-Preferred Trajectories},
  author = {Returaj Burnwal and Nirav Pravinbhai Bhatt and Balaraman Ravindran},
  journal= {arXiv preprint arXiv:2511.08136},
  year   = {2025}
}

备注

18 pages, Accepted at AAAI 2026