中文

通过冲突感知梯度一致性增强提升视觉强化学习的泛化能力

计算机视觉与模式识别 2023-08-03 v1

摘要

学习一个对未知环境具有良好泛化能力的策略在视觉强化学习中仍具挑战性但至关重要。尽管增强组合在监督学习泛化中取得成功,将其直接应用于视觉 RL 算法可能损害训练效率,遭遇严重的性能下降。本文中,我们首先进行定性分析并阐明主要原因:(i) 高方差梯度幅值,以及 (ii) 各种增强方法中存在的梯度冲突。为缓解这些问题,我们提出一种通用的策略梯度优化框架,称为冲突感知梯度一致性增强(CG2A),更好地将增强组合整合进视觉 RL 算法以解决泛化偏差。具体而言,CG2A 开发了梯度一致性求解器以自适应平衡变化的梯度幅值,并引入软梯度手术策略以缓解梯度冲突。大量实验表明,CG2A 显著提升了视觉 RL 算法的泛化性能与样本效率。

关键词

引用

@article{arxiv.2308.01194,
  title  = {Improving Generalization in Visual Reinforcement Learning via Conflict-aware Gradient Agreement Augmentation},
  author = {Siao Liu and Zhaoyu Chen and Yang Liu and Yuzheng Wang and Dingkang Yang and Zhile Zhao and Ziqing Zhou and Xie Yi and Wei Li and Wenqiang Zhang and Zhongxue Gan},
  journal= {arXiv preprint arXiv:2308.01194},
  year   = {2023}
}

备注

accepted by iccv2023