CHIRPs:面向终身强化学习的改变诱导遗憾代理指标
机器学习
2025-01-31 v2
摘要
强化学习(RL)智能体的训练成本高昂,且对环境变化十分脆弱。当存在许多不断变化的任务时,它们通常表现不佳,这阻碍了它们在现实世界中的广泛部署。目前已提出许多终身RL智能体设计,以缓解诸如灾难性遗忘等问题,或展示在发生变化时具有正向迁移等积极特性。然而,尚无先前的工作确立是否可以从变化本身预测对智能体性能的影响。理解这一关系将有助于智能体主动减轻变化的影响,从而改善学习性能。我们提出了改变诱导遗憾代理(CHIRP)指标,将变化与智能体性能下降联系起来,并使用两个环境展示了CHIRP在终身学习中的效用。在一个基准测试中,基于CHIRP的简单智能体比次优方法的性能高出48%,在第二个基准测试的10个任务中的8个获得了最佳成功率,而现有的终身RL智能体在该基准测试中表现困难。
引用
@article{arxiv.2409.03577,
title = {CHIRPs: Change-Induced Regret Proxy metrics for Lifelong Reinforcement Learning},
author = {John Birkbeck and Adam Sobey and Federico Cerutti and Katherine Heseltine Hurley Flynn and Timothy J. Norman},
journal= {arXiv preprint arXiv:2409.03577},
year = {2025}
}
备注
7 pages, 9 figures