中文

基于深度强化学习的双体对抗框架用于鲁棒泛化

机器学习 2025-10-09 v2 人工智能

摘要

最近,受神经网络强大能力的赋能,强化学习(RL)已成功解决诸多具有挑战性的任务。然而,这些模型虽然展现出增强的决策能力,却日益容易产生过拟合现象。例如,训练好的 RL 模型常常无法对同一任务的微小变体(例如背景颜色的变化或其他小幅语义差异)进行泛化。为此,我们提出了双体对抗策略学习框架,使智能体能够在不引入任何人类先验知识的情况下,自主学习其背后的语义。具体而言,本框架涉及两个智能体之间的博弈过程:每个智能体寻求最大化对对手策略产生冲击的能力,通过为同一状态生成表征差异来实现,而同时保持对此类冲击的稳定性。这种相互作用鼓励智能体学习通用策略,能够处理高维观测中的无关特征。大量实验结果表明,在 Procgen 基准测试上,對抗过程显著提高了两个智能体的泛化性能,并且该框架可应用于各种 RL 算法(例如近端策略优化(PPO))。在该对抗框架下,RL 智能体相较于基线方法在一般难度任务中表现出显著优势,标志着深度强化学习泛化能力取得了重要进展。

关键词

引用

@article{arxiv.2501.17384,
  title  = {A Dual-Agent Adversarial Framework for Robust Generalization in Deep Reinforcement Learning},
  author = {Zhengpeng Xie and Yulong Zhang},
  journal= {arXiv preprint arXiv:2501.17384},
  year   = {2025}
}