中文

基于双近似表示的稳定离线价值函数学习

机器学习 2026-01-21 v4 人工智能

摘要

在强化学习中,离线价值函数学习是使用离线数据集来估计在给定目标策略的情况下,从每个状态获取折扣回报的期望值。该程序的稳定性,即是否收敛到其固定点,严密地取决于状态-动作对的表示。学习得不好的表示会使价值函数学习不稳定,甚至发散。因此,通过显式塑造状态-动作表示来稳定价值函数学习至关重要。最近,双近似基于算法在控制领域的表示方面显示出前景。然而,仍不清楚这类方法是否能稳定价值函数学习。本文调查了这个问题并肯定了答案。我们引入了一个称为核离线策略评估(bisimulation-based representations for offline policy evaluation, \textsc{krope})的双近似算法。\textsc{krope}使用核函数塑造状态-动作表示,使得在目标策略下,具有相似即时奖励且导致相似下一个状态-动作对的状态-动作对也具有相似的表示。我们证明\textsc{krope}:1)学习稳定的表示,2)导致低于基线的价值误差。我们的分析提供了关于双近似方法稳定性特性的新理论见解,表明实践者可以使用这些方法来提高离线强化学习代理评估的稳定性和准确性。

关键词

引用

@article{arxiv.2410.01643,
  title  = {Stable Offline Value Function Learning with Bisimulation-based Representations},
  author = {Brahma S. Pavse and Yudong Chen and Qiaomin Xie and Josiah P. Hanna},
  journal= {arXiv preprint arXiv:2410.01643},
  year   = {2026}
}

备注

Accepted at the International Conference on Machine Learning (ICML) 2025