中文

通过全局 Lipschitz 正则化实现鲁棒行为克隆

机器学习 2025-08-12 v2 人工智能

摘要

行为克隆(Behavior Cloning, BC)是一种有效的模仿学习技术,甚至被部分采用于安全关键领域,如自动驾驶。BC 通过使用仅由专家演示的状态-动作数据集来训练策略,而无需与环境进行额外交互。然而,在部署过程中,策略的观测值可能包含测量误差或对抗性扰动。由于观测值可能偏离真实状态,这些扰动可能会误导智能体做出次优动作。本文采用全局 Lipschitz 正则化方法来增强所学习策略网络的鲁棒性。我们进一步证明,所得全局 Lipschitz 性质可为策略提供关于不同有界范数扰动的鲁棒性认证。随后,我们提出一种构建确保策略鲁棒性的 Lipschitz 神经网络的方法。我们在 Gymnasium 中的多个环境中对我们的理论进行了实证验证。

关键词

引用

@article{arxiv.2506.19250,
  title  = {Robust Behavior Cloning Via Global Lipschitz Regularization},
  author = {Shili Wu and Yizhao Jin and Puhua Niu and Aniruddha Datta and Sean B. Andersson},
  journal= {arXiv preprint arXiv:2506.19250},
  year   = {2025}
}