Markov 决策过程中的反事实影响
人工智能
2025-03-28 v2
摘要
我们的工作解决了 Markov 决策过程(MDP)反事实推断背景下的一项基本问题。给定一条 MDP 路径 ,此类推断允许我们导出反事实路径 ,用以描述在不同于 中所观测到的动作序列下 的假设版本。然而,随着反事实状态和动作随时间偏离观测值,观测 可能不再影响反事实世界,这意味着分析不再针对单个观测量身定制,从而产生的是干预结果而非反事实结果。尽管该问题具体影响了用于 MDP 反事实的流行 Gumbel-max 结构因果模型,但至今一直被忽视。在本工作中,我们基于对反事实分布和干预分布的比较,引入了对影响的形式化刻画。我们设计了一种算法来构建自动满足影响约束的反事实模型。利用此类模型,我们导出的反事实策略不仅对给定奖励结构是最优的,而且保持与观测路径的量身定制关系。尽管策略最优性与影响约束强度之间存在不可避免的权衡,但我们的实验表明,在保持受观测影响的同时导出(近)最优策略是可能的。
引用
@article{arxiv.2402.08514,
title = {Counterfactual Influence in Markov Decision Processes},
author = {Milad Kazemi and Jessica Lally and Ekaterina Tishchenko and Hana Chockler and Nicola Paoletti},
journal= {arXiv preprint arXiv:2402.08514},
year = {2025}
}
备注
12 pages, 6 figures