测量误差和分布迁移下的因果性模仿学习
机器学习
2026-02-02 v1 统计方法学
机器学习
摘要
我们研究了离线模仿学习(Imitation Learning)的情形,其中部分决策相关状态仅通过噪声测量观察到,且训练与部署之间分布可能发生变化。此类设置会诱导潜在的状态-动作相关性,所以无论是对原始测量值进行条件化,还是忽略它们,标准的行为模仿(Behavioral Cloning, BC)都可能在分布迁移下收敛到系统偏差的政策。我们提出了一个通用的框架,用于应对测量误差下的模仿学习,灵感来自显式建模变量之间的因果关系,从而产生一个保留因果解释且对分布迁移鲁棒的目标。基于近似因果推断的思想,我们引入了\texttt{CausIL},将噪声状态观测视为代理变量(proxy variables),并提供了在没有奖励或交互式专家查询的情况下,从演示中恢复目标政策的识别条件。我们开发了针对离散状态空间和连续状态空间的估计器;对于连续空间,我们使用RKHS函数类的对抗性程序来学习所需参数。我们在来自PhysioNet/Computing in Cardiology Challenge 2019队列的半模拟纵向数据上评估了\texttt{CausIL},并在与BC基线相比时,证明其对分布迁移的鲁棒性更佳。
引用
@article{arxiv.2601.22206,
title = {Causal Imitation Learning Under Measurement Error and Distribution Shift},
author = {Shi Bo and AmirEmad Ghassami},
journal= {arXiv preprint arXiv:2601.22206},
year = {2026}
}
备注
28 pages, 3 figures