表格硬度指标在深度强化学习中的局限性:基于Pharos基准的研究
机器学习
2025-09-23 v1
摘要
原则性评估是深度强化学习(RL)取得进展的关键,但其程度滞后于基于表格RL的理论驱动基准。虽然表格设置受益于诸如MDP直径和次优间隙等众所周知的硬度度量,但深度RL基准往往依据直觉和流行度来选择。这引发了一个关键问题:表格硬度指标能否被适配以指导非表格基准测试?我们调查了这一问题,并揭示了一个根本性差距。我们的首要贡献在于表明,非表格环境的难度由表格指标所忽略的决定因素主导:表示学习硬度。相同的底层MDP根据智能体是否接收状态向量或像素级观察,可能呈现截然不同的挑战。为支持这一分析,我们引入了pharos,一个用于原则性RL基准测试的全新开源库,允许对环境结构和智能体表示进行系统化控制。我们使用pharos进行的大量案例研究表明,尽管表格指标提供了一些见解,但它们本身是深度RL智能体性能的差坏预测器。这一工作凸显了迫切需要新的表示感知型硬度度量的需求,并将pharos定位为开发这些度量的关键工具。
引用
@article{arxiv.2509.17092,
title = {On the Limits of Tabular Hardness Metrics for Deep RL: A Study with the Pharos Benchmark},
author = {Michelangelo Conserva and Remo Sasso and Paulo Rauber},
journal= {arXiv preprint arXiv:2509.17092},
year = {2025}
}