基于函数编码器的零样本强化学习
机器学习
2025-03-24 v3 人工智能
摘要
尽管强化学习(RL)可以解决许多具有挑战性的序列决策问题,但在相关任务之间实现零样本迁移仍然是一个挑战。困难在于为当前任务找到一个好的表示,以便智能体理解它与先前见过的任务有何关联。为了实现零样本迁移,我们引入了函数编码器,这是一种表示学习算法,它将函数表示为已学习的非线性基函数的加权组合。通过使用函数编码器来表示奖励函数或转移函数,智能体可以通过一个连贯的向量表示获得当前任务与先前见过的任务之间关系的信息。因此,智能体能够在运行时在相关任务之间实现迁移,而无需额外的训练。我们通过用函数编码器任务表示增强基本的强化学习算法,在三个强化学习领域中展示了最先进的数据效率、渐近性能和训练稳定性。
引用
@article{arxiv.2401.17173,
title = {Zero-Shot Reinforcement Learning via Function Encoders},
author = {Tyler Ingebrand and Amy Zhang and Ufuk Topcu},
journal= {arXiv preprint arXiv:2401.17173},
year = {2025}
}
备注
A critical issue was found in the multi-agent experiments published in version 2. We rerun the multi-agent experiments on a more challenging, partially observable Markov game