中文

通过因果起源表示应对强化学习中的非平稳性

机器学习 2024-06-04 v3

摘要

在真实场景中,强化学习的应用受到复杂非平稳性的显著挑战。大多数现有方法试图显式建模环境变化,常需不切实际的环境先验知识。本文提出一新视角,认为非平稳性可在状态转移过程中通过复杂因果关系传播并累积,从而加剧其复杂性并影响策略学习。我们认为,通过隐式追踪非平稳性的因果起源可更有效地应对该挑战。为此,我们引入因果起源表示(Causal-Origin REPresentation, COREP)算法。COREP 主要采用引导更新机制来学习状态的稳定图表示,称为因果起源表示。利用该表示,所学策略展现出对非平稳性的出色韧性。我们以基于因果解释的非平稳强化学习理论分析补充了方法,论证了因果起源表示的有效性。实验结果进一步表明 COREP 在解决非平稳性问题上的性能优于现有方法。

关键词

引用

@article{arxiv.2306.02747,
  title  = {Tackling Non-Stationarity in Reinforcement Learning via Causal-Origin Representation},
  author = {Wanpeng Zhang and Yilin Li and Boyu Yang and Zongqing Lu},
  journal= {arXiv preprint arXiv:2306.02747},
  year   = {2024}
}