面向离线到在线强化学习的集成后继表示(Ensemble Successor Representations)
机器学习
2024-05-14 v1 人工智能
摘要
在强化学习(RL)中,由于探索困难,从头开始以在线经验训练策略效率较低。最近,离线强化学习提供了一种可行方案,通过提供一个初始化的离线策略来进行在线细化。然而,现有方法主要是在同一任务中进行离线和在线学习,未考虑离线到在线适应中的任务泛化问题。在实际应用中,常见情况是仅获得来自特定任务的离线数据集,而希望针对多个任务实现快速的在线适应。为此,我们基于对在线强化学习中后继表示(successor representations)用于任务泛化的研究,扩展了该框架以集成离线到在线学习。我们展示了常规方法使用后继特征(successor features)无法有效利用离线数据,也无法通过在线微调提高新任务的性能。为缓解这一问题,我们引入一种新方法,利用离线数据获取一组后继表示,然后构建集成Q函数。这种方法能够从覆盖性不同的数据集中进行稳健的表示学习,并在在线微调阶段实现对新任务Q函数的快速适应。广泛的实证评估提供了强有力的证据,表明该方法在泛化到多样化乃至不可见的任务方面表现卓越。
引用
@article{arxiv.2405.07223,
title = {Ensemble Successor Representations for Task Generalization in Offline-to-Online Reinforcement Learning},
author = {Changhong Wang and Xudong Yu and Chenjia Bai and Qiaosheng Zhang and Zhen Wang},
journal= {arXiv preprint arXiv:2405.07223},
year = {2024}
}
备注
Accepted by Science China Information Sciences