向量值分布强化学习策略评估:一种希尔伯特空间嵌入方法
机器学习
2026-01-28 v1 统计方法学
机器学习
摘要
我们提出了一种(离线)多维分布强化学习框架(KE-DRL),该框架利用希尔伯特空间映射来估计所提议目标策略下多维价值分布的核均值嵌入。在我们的设置中,状态-动作变量是多维且连续的。通过核均值嵌入将概率测度映射到再生核希尔伯特空间,我们的方法用积分概率度量替代了 Wasserstein 度量。这使得在多维状态-动作空间和奖励设置中能够进行高效估计,而在这些设置中直接计算 Wasserstein 距离在计算上具有挑战性。理论上,我们在涉及 Matérn 核族的所提度量下建立了分布贝尔曼算子的收缩性质,并提供了均匀收敛保证。仿真和实证结果表明,在温和的假设(即核的利普希茨连续性和有界性)下,该方法能够进行鲁棒的离线策略评估并恢复核均值嵌入,凸显了基于嵌入的方法在复杂的现实世界决策场景和风险评估中的潜力。
引用
@article{arxiv.2601.18952,
title = {Vector-Valued Distributional Reinforcement Learning Policy Evaluation: A Hilbert Space Embedding Approach},
author = {Mehrdad Mohammadi and Qi Zheng and Ruoqing Zhu},
journal= {arXiv preprint arXiv:2601.18952},
year = {2026}
}