无后悔探索:提高课程发现中后悔近似方法的研究
机器学习
2024-10-31 v3 人工智能
机器人学
摘要
在强化学习中,选择何种数据或环境进行训练以提高下游性能是一个长期且紧迫的热点问题。特别是,无监督环境设计(Unsupervised Environment Design, UED)方法近期受到关注,因为其自适应课程计划有望使代理人对分布内外任务具有鲁棒性。本文聚焦于现有UED方法如何选择训练环境,尤其是任务优先级指标。令人惊讶的是,尽管这些方法在理论上旨在最大化后悔(regret),但实际的近似方法并不与后悔相关,而是与成功率相关。结果是,代理人大量经验来自其已经掌握的环境,对提升其能力贡献微乎其微。换言之,当前方法无法预测直观的“可学习性”度量标准。具体而言,它们无法持续识别那些代理人有时可以解决但并非总能解决的情景。基于我们的分析,我们 developed a method that directly trains on scenarios with high learnability。这种简单直观的方法在多个二元结果环境中超越了现有的UED方法,包括标准的 Minigrid 领域以及受真实世界机器人问题启发的新颖设定。我们进一步引入一种新的对抗性评估程序,直接衡量鲁棒性,紧密对应条件价值风险(Conditional Value at Risk, CVaR)。我们开源了所有代码,并在此展示最终策略的可视化:https://github.com/amacrutherford/sampling-for-learnability
引用
@article{arxiv.2408.15099,
title = {No Regrets: Investigating and Improving Regret Approximations for Curriculum Discovery},
author = {Alexander Rutherford and Michael Beukman and Timon Willi and Bruno Lacerda and Nick Hawes and Jakob Foerster},
journal= {arXiv preprint arXiv:2408.15099},
year = {2024}
}