重新思考RL评估:基准测试是否真正揭示了RL方法的缺陷?
机器学习
2025-10-14 v1 人工智能
摘要
当前基准测试不足以评估大型语言模型(LLMs)在强化学习(RL)中的进展。尽管近期报告了RL在基准测试中的显著提升,但我们发现训练于这些基准测试的训练集几乎 achieves nearly the same performance as training directly on the test sets,表明这些基准测试无法可靠地区分进一步的进展。为研究这一现象,我们引入了诊断套件和Oracle Performance Gap(OPG)指标,用于量化训练于基准测试的训练分割与测试分割之间的性能差异。我们进一步通过压力测试分析了这一现象,发现尽管基准测试得分很高,现有的RL方法在分布迁移、难度水平变化以及反事实情景方面仍难以泛化:这些短coming 未被当前的基准测试所揭示。我们得出结论,当前的基准测试不足以评估泛化性,并提出设计更可靠基准测试的三个核心原则:充分的难度、平衡的评估和分布鲁棒性。
关键词
引用
@article{arxiv.2510.10541,
title = {Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?},
author = {Zihan Chen and Yiming Zhang and Hengguang Zhou and Zenghui Ding and Yining Sun and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:2510.10541},
year = {2025}
}