离线强化学习中的 out-of-distribution 适应:基于因果正规化流的反事实推理
机器学习
2024-05-08 v1 人工智能
摘要
尽管强化学习取得了显著的成功,但其主流的在线学习范式限制了在危险或高成本情境下的广泛应用。离线强化学习作为一种替代方案,从收集的静态数据集中进行学习。然而,这种离线学习引入了称为分布迁移的新挑战,当策略在与训练数据集分布不同的情境中评估时,会导致性能下降。大多数现有离线强化学习方法通过对给定数据集支持信息内的策略正则化来解决此问题,但这种正则化忽略了数据支持之外可能存在的高回报区域的潜力。这促使我们探索新的离线学习技术,通过学习因果关系(因果推理)而非数据相关性,从而在不损害策略性能的前提下实现超出数据支持范围的改进。本文提出了 MOOD-CRL(Model-based Offline OOD-Adapting Causal RL)算法,旨在通过因果推理而非策略正则化方法来解决离线策略训练中的外推挑战。具体而言,开发了因果正规化流(Causal Normalizing Flow, CNF),用于数据生成与增强在离线策略评估与训练中的离散化与奖励函数。基于数据不可变的、基于物理的定性因果图和观察数据,我们发展了一种新型学习方案,用于 CNF 学习定量结构因果模型。结果显示,CNF 具备预测与反事实推理能力,用于序列决策任务,展现出强大的 OOD 适应潜力。我们的 CNF 基于离线强化学习方法在实证评估中取得显著优势,优于无模型和有模型方法。
引用
@article{arxiv.2405.03892,
title = {Out-of-Distribution Adaptation in Offline RL: Counterfactual Reasoning via Causal Normalizing Flows},
author = {Minjae Cho and Jonathan P. How and Chuangchuang Sun},
journal= {arXiv preprint arXiv:2405.03892},
year = {2024}
}
备注
Submitted for review at IEEE: Neural Networks and Learning Systems