离-policy 评估的商集 DAG:前向流重要性抽样与精确 Slate Propensity
机器学习
2026-05-29 v1 人工智能
摘要
离-policy 评估估计目标策略在使用不同行为策略收集的数据下的表现,这在线测试成本高昂或风险大时至关重要,例如在推荐或医疗领域。标准重要性抽样对每个 logged 轨迹进行重新加权,但它会将生成过程的细节误当作有意义的因素,即使评估目标不关心这些细节:例如,一个自回归式 Slate 推荐系统可能会生成一个有序的物品序列,而奖励和下游估计器只依赖于无序的 Slate。这会导致杂质方差和计算鸿沟,因为精确的无序 Slate Propensity 需要对所有生成顺序进行求和。我们引入一种商集-DAG 思路,通过合并等价于评估的历史,并在合并图上使用目标到行为的前向流比率来分配权重。对于基于集合-足够的下-item 接口的 Slate 推荐系统,这产生 Forward-DP,一种子集-DAG 动态规划程序,用于在无指数枚举的情况下计算精确的无序 Propensity。所得的 propensity 原语使基于 propensity 的评估和模型选择在上下文依赖的自回归式 Slate 记录器中变得可行。
引用
@article{arxiv.2605.29500,
title = {Quotient DAGs for Off-Policy Evaluation:Forward-Flow Importance Sampling and Exact Slate Propensities},
author = {Ziwen Xie and Shaowen Xiang and Hongyu He and Dianbo Liu},
journal= {arXiv preprint arXiv:2605.29500},
year = {2026}
}
备注
31 pages, 3 figures, 7 tables