中文

Markov 决策过程中的反事实影响

人工智能 2025-03-28 v2

摘要

我们的工作解决了 Markov 决策过程(MDP)反事实推断背景下的一项基本问题。给定一条 MDP 路径 τ\tau,此类推断允许我们导出反事实路径 τ\tau',用以描述在不同于 τ\tau 中所观测到的动作序列下 τ\tau 的假设版本。然而,随着反事实状态和动作随时间偏离观测值,观测 τ\tau 可能不再影响反事实世界,这意味着分析不再针对单个观测量身定制,从而产生的是干预结果而非反事实结果。尽管该问题具体影响了用于 MDP 反事实的流行 Gumbel-max 结构因果模型,但至今一直被忽视。在本工作中,我们基于对反事实分布和干预分布的比较,引入了对影响的形式化刻画。我们设计了一种算法来构建自动满足影响约束的反事实模型。利用此类模型,我们导出的反事实策略不仅对给定奖励结构是最优的,而且保持与观测路径的量身定制关系。尽管策略最优性与影响约束强度之间存在不可避免的权衡,但我们的实验表明,在保持受观测影响的同时导出(近)最优策略是可能的。

关键词

引用

@article{arxiv.2402.08514,
  title  = {Counterfactual Influence in Markov Decision Processes},
  author = {Milad Kazemi and Jessica Lally and Ekaterina Tishchenko and Hana Chockler and Nicola Paoletti},
  journal= {arXiv preprint arXiv:2402.08514},
  year   = {2025}
}

备注

12 pages, 6 figures