STITCH-OPE:基于引导扩散的轨迹拼接用于离策略评估
机器人学
2025-05-28 v1 机器学习
摘要
离策略评估(OPE)估计使用从行为策略收集的离线数据来估计目标策略的性能,在机器人或医疗保健等领域至关重要,因为这些领域中直接与环境交互成本高昂或存在风险。现有的 OPE 方法因重要性加权导致方差指数级增长或来自学习动力学模型的误差累积而对高维、长期限的问题无效。为解决这些挑战,我们提出了 STITCH-OPE,一个基于模型的生成框架,利用去噪扩散进行高维状态和动作空间中长期限的 OPE。启动一个在行为数据上预训练的扩散模型,STITCH-OPE 通过利用目标策略的得分函数引导去噪过程,从目标策略生成合成轨迹。STITCH-OPE 提出了两项技术创新,使其在 OPE 中具有优势:(1)通过减去行为策略的得分来防止过度正则化,(2)通过将部分轨迹拼接成端到端的方式生成长期限轨迹。我们在 D4RL 和 OpenAI Gym 基准测试中进行实验,表明与前沿 OPE 方法相比,STITCH-OPE 在均方误差、相关性和后悔指标上实现了显著改进。
引用
@article{arxiv.2505.20781,
title = {STITCH-OPE: Trajectory Stitching with Guided Diffusion for Off-Policy Evaluation},
author = {Hossein Goli and Michael Gimelfarb and Nathan Samuel de Lara and Haruki Nishimura and Masha Itkina and Florian Shkurti},
journal= {arXiv preprint arXiv:2505.20781},
year = {2025}
}