审视被忽略之处:抑制基于上下文的离线元强化学习中的任务表征偏移
机器学习
2025-02-04 v4 人工智能
摘要
离线元强化学习(OMRL)通过利用预收集数据和元学习技术,已成为一种用于避免交互并实现强泛化性能的有前景的方法。以往基于上下文的方法主要依赖于这样一种直觉:只要上下文编码器遵循最大化任务变量 与其潜在表征 之间互信息()的原则,而策略采用以学习到的任务表征为条件的标准离线强化学习(RL)算法,那么上下文编码器和策略之间的交替优化就能带来性能提升。尽管取得了可喜的成果,但这种直觉在性能提升方面的理论依据仍探索不足。受基于模型的 RL 领域中回报差异方案的启发,我们发现先前的优化框架可以与最大化预期回报的一般 RL 目标相联系,从而解释性能提升。此外,在仔细审视该优化框架后,我们观察到单调性能提升的条件并未考虑任务表征的变化。当考虑这些变化时,先前建立的条件可能不再足以保证单调性,从而损害优化过程。我们将此问题命名为任务表征偏移,并从理论上证明,通过适当的上下文编码器更新可以保证单调性能提升。我们的工作为 OMRL 开辟了新途径,促进了对任务表征与性能提升之间关系的更好理解。
引用
@article{arxiv.2405.12001,
title = {Scrutinize What We Ignore: Reining In Task Representation Shift Of Context-Based Offline Meta Reinforcement Learning},
author = {Hai Zhang and Boyuan Zheng and Tianying Ji and Jinhang Liu and Anqi Guo and Junqiao Zhao and Lanqing Li},
journal= {arXiv preprint arXiv:2405.12001},
year = {2025}
}
备注
Accept at ICLR 2025