通过全局 Lipschitz 正则化实现鲁棒行为克隆
机器学习
2025-08-12 v2 人工智能
摘要
行为克隆(Behavior Cloning, BC)是一种有效的模仿学习技术,甚至被部分采用于安全关键领域,如自动驾驶。BC 通过使用仅由专家演示的状态-动作数据集来训练策略,而无需与环境进行额外交互。然而,在部署过程中,策略的观测值可能包含测量误差或对抗性扰动。由于观测值可能偏离真实状态,这些扰动可能会误导智能体做出次优动作。本文采用全局 Lipschitz 正则化方法来增强所学习策略网络的鲁棒性。我们进一步证明,所得全局 Lipschitz 性质可为策略提供关于不同有界范数扰动的鲁棒性认证。随后,我们提出一种构建确保策略鲁棒性的 Lipschitz 神经网络的方法。我们在 Gymnasium 中的多个环境中对我们的理论进行了实证验证。
引用
@article{arxiv.2506.19250,
title = {Robust Behavior Cloning Via Global Lipschitz Regularization},
author = {Shili Wu and Yizhao Jin and Puhua Niu and Aniruddha Datta and Sean B. Andersson},
journal= {arXiv preprint arXiv:2506.19250},
year = {2025}
}