密度比加权行为克隆:从受污染数据集中学习控制策略
机器学习
2026-05-19 v2 系统与控制
系统与控制
摘要
离线强化学习(RL)通过固定数据集进行策略优化,使其适用于在线探索不可行的安全关键应用。然而,这些数据集常常受到对抗性投毒、系统错误或低质量样本的污染,导致标准行为克隆(BC)和离线 RL 方法的策略性能下降。本文引入密度比加权行为克隆(Weighted BC),这是一种稳健的仿照学习方法,通过小规模的验证干净参考集估计轨迹级别的密度比,通过二分类判别器实现。这些比率被裁剪后用作 BC 目标中的权重,以优先干净的专家行为,同时削弱或丢弃受污染的数据,而无需了解污染机制。我们建立了理论保证,表明在有限样本下,Weighted BC 可收敛至干净专家策略,其样本界限与污染率无关。我们建立了综合的评估框架,纳入各种投毒协议(奖励、状态、转换和动作)在连续控制基准测试上。实验表明,Weighted BC 在高污染率下仍能保持接近最优性能,超越传统 BC、批量受限 Q 学习(BCQ)和行为正则化 actor-critic(BRAC)等基线方法。
引用
@article{arxiv.2510.01479,
title = {Density-Ratio Weighted Behavioral Cloning: Learning Control Policies from Corrupted Datasets},
author = {Shriram Karpoora Sundara Pandian and Ali Baheri},
journal= {arXiv preprint arXiv:2510.01479},
year = {2026}
}