中文

评估感知的强化学习

人工智能 2026-03-23 v3 机器学习

摘要

策略评估是许多强化学习(RL)算法的核心组成部分,也是确保 RL 策略安全部署的关键工具。然而,现有的策略评估方法常常存在高方差或偏差的问题。为解决这些问题,我们引入了评估感知的强化学习(EvA-RL),这是一个通用的策略学习框架,它在训练时就考虑评估准确性,这与标准的事后策略评估方法不同。具体而言,EvA-RL 直接优化策略,使其在具有高性能的同时,也能实现高效且准确的评估。我们提供了 EvA-RL 的一个实例,并通过理论分析和实证结果相结合的方式证明,EvA-RL 能有效地在评估准确性和期望回报之间进行权衡。最后,我们表明评估感知的策略和评估机制本身可以协同学习,以缓解这种权衡,从而在不显著牺牲策略性能的情况下获得评估收益。这项工作开辟了一个新的研究方向,将可靠评估提升为强化学习中的首要原则。

关键词

引用

@article{arxiv.2509.19464,
  title  = {Evaluation-Aware Reinforcement Learning},
  author = {Shripad Vilasrao Deshmukh and Will Schwarzer and Scott Niekum},
  journal= {arXiv preprint arXiv:2509.19464},
  year   = {2026}
}

备注

11 pages