中文

基于流动任务推断与特征过度泛化自适应纠正的离线元强化学习

机器学习 2026-01-13 v1

摘要

离线元强化学习(OMRL)结合了从多样化数据集中进行离线学习与元强化学习对新任务的适应性,为RL代理提供了安全且高效的知识获取路径。然而,OMRL仍因离线RL中的外分布(OOD)动作导致 extrapolation 误差,这在元RL设置下的广泛任务分布和马尔可夫决策过程(MDP)模糊性下受到制约。现有研究表明,QQ网络的泛化性影响离线RL中的 extrapolation 误差。本文通过将QQ值分解为特征和权重组成部分来探讨这一关系,观察到在高质量数据情况下,分解提升了适应性和收敛性,但在复杂任务中常导致策略退化或崩溃。我们观察到,分解后的QQ值在特征遇到OOD样本时会引入较大的估计偏差,一种我们称之为"特征过度泛化"的现象。为此,我们提出了FLORA,通过建模特征分布来识别OOD样本并估计其不确定性。FLORA集成了返回反馈机制以自适应调整特征组件。此外,为学习精确的任务表征,FLORA显式地使用一系列可逆变换来建模复杂的任务分布。我们在各种环境中理论和实证地表明,FLORA在适应性和元策略改进方面优于基线方法。

关键词

引用

@article{arxiv.2601.07164,
  title  = {Offline Meta-Reinforcement Learning with Flow-Based Task Inference and Adaptive Correction of Feature Overgeneralization},
  author = {Min Wang and Xin Li and Mingzhong Wang and Hasnaa Bennis},
  journal= {arXiv preprint arXiv:2601.07164},
  year   = {2026}
}