通过因果起源表示应对强化学习中的非平稳性
机器学习
2024-06-04 v3
摘要
在真实场景中,强化学习的应用受到复杂非平稳性的显著挑战。大多数现有方法试图显式建模环境变化,常需不切实际的环境先验知识。本文提出一新视角,认为非平稳性可在状态转移过程中通过复杂因果关系传播并累积,从而加剧其复杂性并影响策略学习。我们认为,通过隐式追踪非平稳性的因果起源可更有效地应对该挑战。为此,我们引入因果起源表示(Causal-Origin REPresentation, COREP)算法。COREP 主要采用引导更新机制来学习状态的稳定图表示,称为因果起源表示。利用该表示,所学策略展现出对非平稳性的出色韧性。我们以基于因果解释的非平稳强化学习理论分析补充了方法,论证了因果起源表示的有效性。实验结果进一步表明 COREP 在解决非平稳性问题上的性能优于现有方法。
引用
@article{arxiv.2306.02747,
title = {Tackling Non-Stationarity in Reinforcement Learning via Causal-Origin Representation},
author = {Wanpeng Zhang and Yilin Li and Boyu Yang and Zongqing Lu},
journal= {arXiv preprint arXiv:2306.02747},
year = {2024}
}