中文

基于层次策略表征学习的高效无监督环境设计

人工智能 2026-02-11 v1

摘要

无监督环境设计(UED)已成为通过自动课程生成开发通用智能体的有前景的方法。流行的UED方法侧重于开放性,教师算法依赖随机过程以无限生成有用的环境。但在资源受限的情况下,教师-学生相互作用机会有限,这一假设变得不切实际。为此,我们引入了一个层次马尔可夫决策过程(MDP)框架用于环境设计。我们的框架具备一种教师智能体,该智能体利用来自发现的评估环境中派生的学生策略表征,使其能够基于学生能力生成训练环境。为提高效率,我们纳入一种生成模型,通过合成数据丰富教师的训练数据集,从而减少教师-学生相互作用的需求。在几个领域的实验中,我们展示了该方法在单个episodes中以更少的教师-学生相互作用情况下超越基线方法。结果表明,该方法适用于训练机会有限的场景。

关键词

引用

@article{arxiv.2602.09813,
  title  = {Efficient Unsupervised Environment Design through Hierarchical Policy Representation Learning},
  author = {Dexun Li and Sidney Tio and Pradeep Varakantham},
  journal= {arXiv preprint arXiv:2602.09813},
  year   = {2026}
}