中文

基于后悔引导扩散模型的对抗环境设计

机器学习 2024-11-18 v2 人工智能

摘要

在深度强化学习中,训练能够抵御环境变化的智能体仍是一个重大挑战。无监督环境设计(Unsupervised Environment Design, UED)最近涌现出来用于解决此问题,通过生成一套针对智能体能力所定制的训练环境。虽然已有工作表明 UED 有潜力学习稳健策略,但其性能受限于环境生成能力。为此,我们提出一种新型 UED 算法——后悔引导扩散模型对抗环境设计(Adversarial Environment Design via Regret-Guided Diffusion Models, 简称 ADD)。该方法利用智能体的后悔值引导基于扩散的环境生成器,以产生对智能体而既具挑战性又有利于进一步改进的环境。通过利用扩散模型的表示能力,ADD 能够直接生成对抗环境,同时保持训练环境的多样性,从而使智能体能够有效学习稳健策略。我们的实验结果表明,所提方法成功生成一条有教导意义的环境课程,在对 novel、离散分布环境的零样 generalization 中超越 UED baseline。项目页面: https://rllab-snu.github.io/projects/ADD

关键词

引用

@article{arxiv.2410.19715,
  title  = {Adversarial Environment Design via Regret-Guided Diffusion Models},
  author = {Hojun Chung and Junseo Lee and Minsoo Kim and Dohyeong Kim and Songhwai Oh},
  journal= {arXiv preprint arXiv:2410.19715},
  year   = {2024}
}

备注

38th Conference on Neural Information Processing Systems