中文

CLUTR:基于无监督任务表征学习的课程学习

机器学习 2024-03-18 v2 人工智能

摘要

强化学习(RL)算法常因样本效率低与难以泛化而为人所知。近来,无监督环境设计(UED)作为一种通过同时学习任务分布与在生成任务上的智能体策略来实现零样本泛化的新范式涌现。这是一个非平稳过程,任务分布随智能体策略演化,导致随时间的不稳定性。尽管以往工作展示了此类方法的潜力,但从任务空间中有效采样仍是一开放挑战,制约了这些方法。为此,我们提出CLUTR:一种将任务表征与课程学习解耦为两阶段优化的新型无监督课程学习算法。它首先在随机生成任务上训练循环变分自编码器以学习潜任务流形。接着,教师智能体通过在该流形上采样的一组潜任务上最大化基于极小极大REGRET的目标来创建课程。利用固定的预训练任务流形,我们表明CLUTR成功克服了非平稳问题并提升了稳定性。实验结果显示,CLUTR在具挑战性的CarRacing与导航环境中优于原则性且流行的UED方法PAIRED:零样本泛化分别实现10.6倍与45%的提升。CLUTR在CarRacing上也与非UED最先进水平表现相当,同时所需环境交互少500倍。

关键词

引用

@article{arxiv.2210.10243,
  title  = {CLUTR: Curriculum Learning via Unsupervised Task Representation Learning},
  author = {Abdus Salam Azad and Izzeddin Gur and Jasper Emhoff and Nathaniel Alexis and Aleksandra Faust and Pieter Abbeel and Ion Stoica},
  journal= {arXiv preprint arXiv:2210.10243},
  year   = {2024}
}

备注

Preprint, Currently Under Review