中文

测量误差和分布迁移下的因果性模仿学习

机器学习 2026-02-02 v1 统计方法学 机器学习

摘要

我们研究了离线模仿学习(Imitation Learning)的情形,其中部分决策相关状态仅通过噪声测量观察到,且训练与部署之间分布可能发生变化。此类设置会诱导潜在的状态-动作相关性,所以无论是对原始测量值进行条件化,还是忽略它们,标准的行为模仿(Behavioral Cloning, BC)都可能在分布迁移下收敛到系统偏差的政策。我们提出了一个通用的框架,用于应对测量误差下的模仿学习,灵感来自显式建模变量之间的因果关系,从而产生一个保留因果解释且对分布迁移鲁棒的目标。基于近似因果推断的思想,我们引入了\texttt{CausIL},将噪声状态观测视为代理变量(proxy variables),并提供了在没有奖励或交互式专家查询的情况下,从演示中恢复目标政策的识别条件。我们开发了针对离散状态空间和连续状态空间的估计器;对于连续空间,我们使用RKHS函数类的对抗性程序来学习所需参数。我们在来自PhysioNet/Computing in Cardiology Challenge 2019队列的半模拟纵向数据上评估了\texttt{CausIL},并在与BC基线相比时,证明其对分布迁移的鲁棒性更佳。

关键词

引用

@article{arxiv.2601.22206,
  title  = {Causal Imitation Learning Under Measurement Error and Distribution Shift},
  author = {Shi Bo and AmirEmad Ghassami},
  journal= {arXiv preprint arXiv:2601.22206},
  year   = {2026}
}

备注

28 pages, 3 figures