ergodic风险度量:面向持续强化学习的风险意识基础
机器学习
2026-05-05 v3 人工智能
摘要
持续强化学习(continual RL)旨在形式化强化学习中终身学习和无限适应的概念。具体而言,持续强化学习的目标是开发能够在保持有用信息的同时适应新情景的强化学习智能体。在此之前,持续强化学习几乎完全通过风险中性决策框架进行探讨,即智能体旨在优化其长期性能的期望。在本工作中,我们首次通过风险意识决策框架对持续强化学习进行正式的理论处理,即智能体的行为旨在优化超出平均值的长期性能度量。具体而言,我们展示了在当前形式下,风险度量理论(广泛用于非持续风险意识强化学习的理论基础)与持续学习不兼容。随后,基于这一洞见,我们将风险度量理论扩展到持续环境中,引入一种新的ergodic风险度量类别,并证明其与持续学习兼容。最后,我们提供了一个持续风险意识学习案例研究,以及实证结果,表明ergodic风险度量在持续环境中具有直观的吸引力。
关键词
引用
@article{arxiv.2510.02945,
title = {Ergodic Risk Measures: Towards a Risk-Aware Foundation for Continual Reinforcement Learning},
author = {Juan Sebastian Rojas and Chi-Guhn Lee},
journal= {arXiv preprint arXiv:2510.02945},
year = {2026}
}