R2R2:基于自预测学习中冗余消除的强化经验复用鲁棒表征
机器学习
2026-05-15 v1 人工智能
摘要
对于现实世界机器人等数据稀缺领域的强化学习,密集的数据复用提高了效率,但会导致过拟合。虽然先前的工作关注评论家偏差,但在高更新数据比 (UTD) 机制下,自预测学习 (SPL) 中的表征级不稳定性仍未得到充分探索。为了弥补这一差距,我们提出了基于冗余消除的鲁棒表征 (R2R2),一种 SPL 内的正则化方法。我们从理论上发现标准的零中心化与 SPL 的谱特性相冲突,并据此设计了一个非中心化目标。我们在 TD7 等 SPL 原生算法上验证了 R2R2。此外,为了证明其与先前进展的正交性,我们通过集成定制的 SPL 模块(称为 SimbaV2-SPL)扩展了最初缺乏 SPL 的最先进模型 SimbaV2。在 11 个连续控制任务上的实验证实,R2R2 有效缓解了过拟合;具体而言,在 UTD 比率为 20 时,它使 TD7 提升了约 22%,并在 SimbaV2-SPL 的基础上提供了额外增益,而 SimbaV2-SPL 本身也确立了新的最先进水平。代码可在以下地址找到:https://github.com/songsang7/R2R2
引用
@article{arxiv.2605.14026,
title = {R2R2: Robust Representation for Intensive Experience Reuse via Redundancy Reduction in Self-Predictive Learning},
author = {Sanghyeob Song and Donghyeok Lee and Jinsik Kim and Sungroh Yoon},
journal= {arXiv preprint arXiv:2605.14026},
year = {2026}
}
备注
Accepted at the Forty-Third International Conference on Machine Learning (ICML 2026). This is the camera-ready version