中文

审视被忽略之处:抑制基于上下文的离线元强化学习中的任务表征偏移

机器学习 2025-02-04 v4 人工智能

摘要

离线元强化学习(OMRL)通过利用预收集数据和元学习技术,已成为一种用于避免交互并实现强泛化性能的有前景的方法。以往基于上下文的方法主要依赖于这样一种直觉:只要上下文编码器遵循最大化任务变量 MM 与其潜在表征 ZZ 之间互信息(I(Z;M)I(Z;M))的原则,而策略采用以学习到的任务表征为条件的标准离线强化学习(RL)算法,那么上下文编码器和策略之间的交替优化就能带来性能提升。尽管取得了可喜的成果,但这种直觉在性能提升方面的理论依据仍探索不足。受基于模型的 RL 领域中回报差异方案的启发,我们发现先前的优化框架可以与最大化预期回报的一般 RL 目标相联系,从而解释性能提升。此外,在仔细审视该优化框架后,我们观察到单调性能提升的条件并未考虑任务表征的变化。当考虑这些变化时,先前建立的条件可能不再足以保证单调性,从而损害优化过程。我们将此问题命名为任务表征偏移,并从理论上证明,通过适当的上下文编码器更新可以保证单调性能提升。我们的工作为 OMRL 开辟了新途径,促进了对任务表征与性能提升之间关系的更好理解。

关键词

引用

@article{arxiv.2405.12001,
  title  = {Scrutinize What We Ignore: Reining In Task Representation Shift Of Context-Based Offline Meta Reinforcement Learning},
  author = {Hai Zhang and Boyuan Zheng and Tianying Ji and Jinhang Liu and Anqi Guo and Junqiao Zhao and Lanqing Li},
  journal= {arXiv preprint arXiv:2405.12001},
  year   = {2025}
}

备注

Accept at ICLR 2025