基于折扣活性公式的机器人操作策略离线评估
机器人学
2026-05-13 v1 人工智能
摘要
策略评估是机器人策略开发和部署流程中的基础组成部分。在现代操作系统中,这个问题尤其具有挑战性:奖励通常是稀疏的,评估回放的任务进展通常是非单调的(因为策略会表现出恢复行为),并且评估回放的长度必然是有限的。这种有限长度引入了截断偏差,打破了依赖贝尔曼方程/最优性原理的标准方法所基于的无限时域假设。在这项工作中,我们基于活性贝尔曼算子,提出了一个从稀疏奖励中进行离线策略评估的框架。我们的公式将策略评估解释为一个任务完成问题,并产生了一个对有限时域截断具有鲁棒性的保守不动点值函数。我们分析了所提出算子的理论性质,包括压缩性保证,并展示了它如何在编码任务进展的同时减轻截断偏差。我们使用一个视觉-语言-动作模型和一个扩散策略在两个模拟操作任务上评估了我们的方法,并使用人类演示在一个叠布任务上进行了评估。实证结果表明,我们的方法能更准确地反映任务进展,并显著减少了截断偏差,优于 TD(0) 和蒙特卡洛策略评估等经典基线。
引用
@article{arxiv.2605.11479,
title = {Offline Policy Evaluation for Manipulation Policies via Discounted Liveness Formulation},
author = {Hao Wang and Joshua Bowden and Colton Crosby and Somil Bansal},
journal= {arXiv preprint arXiv:2605.11479},
year = {2026}
}
备注
Published at RSS 2026