中文

UACER:用于鲁棒对抗强化学习的不确定性自适应评论家集成框架

机器学习 2026-01-26 v2 人工智能

摘要

鲁棒对抗强化学习已成为一种有效范式,用于训练智能体处理真实环境中不确定扰动,在自动驾驶和机器人控制等序贯决策领域具有关键应用。在该范式下,智能体训练通常被表述为主角与对手之间的零和马尔可夫博弈,以增强策略的鲁棒性。然而,对手的可训练性不可避免地导致学习动态的非平稳性,从而加剧训练不稳定性和收敛困难,尤其是在高维复杂环境中。在本文中,我们提出了一种新方法,即用于鲁棒对抗强化学习的不确定性自适应评论家集成(UACER),它包含两个组件:1)多样化评论家集成:并行采用一组由 K 个评论家网络组成的多样化集合,以稳定鲁棒对抗强化学习中的 Q 值估计,与传统的单评论家设计相比,降低了方差并增强了鲁棒性。2)时变衰减不确定性(TDU)机制:超越简单的线性组合,我们提出了一种基于方差导出的 Q 值聚合策略,该策略显式地结合认知不确定性,以自适应地调节探索-利用权衡,同时稳定训练过程。在几个具有挑战性的 MuJoCo 控制问题上的综合实验验证了 UACER 的卓越有效性,在整体性能、稳定性和效率方面均优于 SOTA 方法。

关键词

引用

@article{arxiv.2512.10492,
  title  = {UACER: An Uncertainty-Adaptive Critic Ensemble Framework for Robust Adversarial Reinforcement Learning},
  author = {Jiaxi Wu and Tiantian Zhang and Yuxing Wang and Yongzhe Chang and Xueqian Wang},
  journal= {arXiv preprint arXiv:2512.10492},
  year   = {2026}
}