用于训练鲁棒世界模型的无奖励课程
机器学习
2024-01-25 v2
摘要
近来,开发能够在新任务上无需额外环境训练即可适应的通用智能体引发了浓厚兴趣。从无奖励探索中学习世界模型是一种有前景的方法,并使得能够利用想象经验为新任务训练策略。然而,实现通用智能体需要跨不同环境的鲁棒性。在本工作中,我们提出了无奖励设定下生成课程以训练鲁棒世界模型这一新问题。我们从所有环境实例上的极小极大遗憾(minimax regret)角度考虑鲁棒性,并表明极小极大遗憾可关联到最小化世界模型在各环境实例间的最大误差。该结果启发了我们的算法 WAKER:面向鲁棒性的跨环境加权知识获取(Weighted Acquisition of Knowledge across Environments for Robustness)。WAKER 基于世界模型对各环境的估计误差来选择数据收集的环境。我们的实验表明,WAKER 优于若干基线方法,实现了改进的鲁棒性、效率与泛化能力。
引用
@article{arxiv.2306.09205,
title = {Reward-Free Curricula for Training Robust World Models},
author = {Marc Rigter and Minqi Jiang and Ingmar Posner},
journal= {arXiv preprint arXiv:2306.09205},
year = {2024}
}
备注
ICLR 2024